Blog

Local bilang default, cloud bilang fallback: kung paano napunta sa machine ng user ang polish step ng Cue

Ang “polish step” ng dictation ng Cue ay idinisenyong cloud-first na may local fallback. Binaligtad iyon ng isang benchmark na may 227 sample. Kung ano ang itinala ng case study tungkol sa desisyon.

Inilathala noong

Ang dictation ng Cue ay may “polish step”: ang hilaw na transcript, kasama ang mga filler word at kulang na bantas, ay ginagawang text na nababasa sa paraang gusto ng nagsalita. Isang pagsukat ang nagpasya kung saan tatakbo ang hakbang na iyon, at pampubliko ang pagsukat. Sinusundan ng post na ito ang case study ng Google DeepMind, na may mga numerong napapanahon noong Mayo 2026, at walang idinaragdag na hindi isinasaad sa pahina.

Ang orihinal na disenyo

Binuo ang hakbang para gumamit ng cloud model, na may local model bilang fallback, sa pag-aakalang mas tumpak na magpapakinis ang isang mas malaking model. Ang nakasaad na layunin ng team para sa hakbang ay text na nababasa na parang galing sa user sa halip na parang galing sa isang model: naibalik ang mga bantas, nahati-hati ang mga pangungusap, inalis ang mga filler, nang hindi nagpapataw ng isang house style.

Ang pagsukat

Nag-benchmark ang team ng hakbang sa 227 totoong voice sample na sumasaklaw sa English, iba pang mga wika, at halo-halong wika na input. Sa benchmark na iyon, ang Gemma 4 E4B, na tumatakbo nang lokal sa pamamagitan ng Ollama sa Apple Silicon, ang napiling unang model. Bumaba ang median latency ng polish step mula 876 ms hanggang 488 ms, na inilalarawan ng pahina bilang pasok sa budget na itinakda ng team para sa isang hakbang na dapat ay mas mabilis kaysa sa pag-type.

Ang pagbaligtad

Pagkatapos ng benchmark, binaligtad ang arkitektura: ang local model ang naging default at ang cloud model ang naging fallback. Sinusuri ng desktop app sa startup kung tumatakbo ang Ollama; kung hindi, ang polish step ay dumidiretso sa isang cloud model at nagpapatuloy ang dictation.

Kung ano ang nagbago para sa mga user, ayon sa pahina

  • Tumaas nang halos 30 porsiyento ang dictation bawat user sa mga aktibong beta user sa apat na linggo bago at pagkatapos ng pagbabago; ang mga user na dati'y nagdidikta ng maiikling mensahe ay nagsimulang magdikta ng mas mahahaba.
  • Bumaba sa zero ang marginal inference cost ng hakbang, at ibinigay iyon ng pahina bilang dahilan kung bakit walang limitasyon ang dictation sa bawat tier, kasama na ang libre.

Ang hangganan ng pahayag

Ang polish step lang ang lumipat. Ginagawa ang transcription ng isang cloud speech-to-text service bago ang polish step, at ang agent mode ng Cue ay umaasa sa isang cloud model. Iniuulat ng pahina ang mga paunang pagsusuri sa function calling ng Gemma 4 para sa mga self-contained na agent task at tinatawag ang mga itong maaga pa. Samakatuwid, sinasabi ng aming home page na tumatakbo ang polish sa machine ng user at walang sinasabi tungkol sa agent na tumatakbo nang lokal; itinatala ng pahina ng mga platform ang parehong hangganan.

Lahat ng post