Dictarea din Cue are un pas de șlefuire: transcrierea brută, cu cuvintele de umplutură și punctuația lipsă, este transformată într-un text care se citește așa cum a intenționat vorbitorul. Locul unde se execută acest pas a fost decis printr-o măsurătoare, iar măsurătoarea este publică. Această postare urmărește studiul de caz al Google DeepMind, cu cifre actuale la data de mai 2026, și nu adaugă nimic ce pagina nu afirmă.
Designul original
Pasul a fost construit pentru a utiliza un model cloud, cu un model local ca alternativă, pe presupunerea că un model mai mare ar șlefui mai precis. Obiectivul declarat al echipei pentru acest pas a fost un text care să sune ca utilizatorul, nu ca un model: punctuație restaurată, propoziții segmentate, cuvinte de umplutură eliminate, fără a impune un stil al casei.
Măsurătoarea
Echipa a efectuat un benchmark al pasului pe 227 de eșantioane vocale reale, acoperind engleza, alte limbi și intrări în mai multe limbi. Pe acel benchmark, Gemma 4 E4B, rulând local prin Ollama pe Apple Silicon, a fost ales ca model de primă opțiune. Latența mediană a pasului de șlefuire a scăzut de la 876 ms la 488 ms, ceea ce pagina descrie ca fiind în bugetul pe care echipa îl stabilise pentru un pas care trebuie să se simtă mai rapid decât tastarea.
Inversarea
După benchmark, arhitectura a fost inversată: modelul local a devenit implicit, iar modelul cloud, alternativa. Aplicația desktop verifică la pornire dacă Ollama rulează; dacă nu, pasul de șlefuire este direcționat către un model cloud și dictarea continuă.
Ce s-a schimbat pentru utilizatori, conform paginii
- Dictarea per utilizator a crescut cu aproximativ 30 de procente în rândul utilizatorilor activi din versiunea beta în cele patru săptămâni înainte și după schimbare; utilizatorii care dictaseră mesaje scurte au început să dicteze mesaje mai lungi.
- Costul marginal de inferență al pasului a scăzut la zero, iar pagina menționează acest lucru ca fiind motivul pentru care dictarea este nelimitată la fiecare nivel, inclusiv la cel gratuit.
Limita afirmației
Doar pasul de șlefuire s-a mutat. Transcrierea este realizată de un serviciu cloud de conversie a vorbirii în text înainte de pasul de șlefuire, iar modul agent al Cue se bazează pe un model cloud. Pagina raportează evaluări timpurii ale apelării de funcții a Gemma 4 pentru sarcini de agent autonome și le numește timpurii. Prin urmare, pagina noastră principală spune că șlefuirea rulează pe computerul utilizatorului și nu spune nimic despre agentul care rulează local; pagina platformelor consemnează aceeași limită.