Diktovanie v Cue má krok doladenia: surový prepis s výplnkovými slovami a chýbajúcou interpunkciou sa mení na text, ktorý sa číta tak, ako ho rečník zamýšľal. O tom, kde sa tento krok vykonáva, rozhodlo meranie a toto meranie je verejné. Tento príspevok vychádza z prípadovej štúdie od Google DeepMind s údajmi aktuálnymi k máju 2026 a nepridáva nič, čo stránka neuvádza.
Pôvodný návrh
Krok bol vytvorený tak, aby používal cloudový model s lokálnym modelom ako zálohou, za predpokladu, že väčší model bude dolaďovať presnejšie. Tímom stanoveným cieľom pre tento krok bol text, ktorý znie ako používateľ, a nie ako model: obnovená interpunkcia, rozdelené vety, odstránené výplnkové slová, bez vnucovania jednotného štýlu.
Meranie
Tím otestoval tento krok na 227 reálnych hlasových vzorkách zahŕňajúcich angličtinu, iné jazyky a zmiešaný jazykový vstup. Na základe tohto benchmarku bol ako model prvej voľby zvolený Gemma 4 E4B, spustený lokálne cez Ollama na Apple Silicon. Medián latencie kroku doladenia klesol z 876 ms na 488 ms, čo stránka opisuje ako v rámci rozpočtu, ktorý tím stanovil pre krok, ktorý musí pôsobiť rýchlejšie ako písanie.
Zvrat
Po benchmarku sa architektúra obrátila: lokálny model sa stal predvoleným a cloudový model záložným. Desktopová aplikácia pri štarte kontroluje, či je spustený Ollama; ak nie je, krok doladenia sa presmeruje na cloudový model a diktovanie pokračuje.
Čo sa podľa stránky zmenilo pre používateľov
- Diktovanie na používateľa vzrástlo približne o 30 percent u aktívnych používateľov beta verzie počas štyroch týždňov pred a po zmene; používatelia, ktorí diktovali krátke správy, začali diktovať dlhšie.
- Marginálne náklady na inferenciu tohto kroku klesli na nulu a stránka to uvádza ako dôvod, prečo je diktovanie neobmedzené v každom pláne, vrátane bezplatného.
Hranice tvrdenia
Presunul sa iba krok doladenia. Prepis sa vykonáva cloudovou službou prevodu reči na text pred krokom doladenia a režim agenta v Cue sa spolieha na cloudový model. Stránka uvádza skoré hodnotenia volania funkcií modelu Gemma 4 pre samostatné úlohy agenta a označuje ich za počiatočné. Naša domovská stránka preto uvádza, že doladenie beží na zariadení používateľa a nehovorí nič o tom, že by agent bežal lokálne; stránka platformy zaznamenáva rovnakú hranicu.