Cues diktering har et finpudsnings-trin: den rå transskription, med dens fyldord og manglende tegnsætning, bliver til tekst, der læses, som taleren mente det. Hvor det trin kører, blev besluttet ved en måling, og målingen er offentlig. Dette indlæg følger Google DeepMinds casestudie, med tal gældende pr. maj 2026, og tilføjer intet, som siden ikke angiver.
Det oprindelige design
Trinnet blev bygget til at bruge en cloud-model, med en lokal model som fallback, under antagelse af, at en større model ville finpudse mere præcist. Teamets erklærede mål for trinnet var tekst, der lød som brugeren snarere end som en model: tegnsætning gendannet, sætninger segmenteret, fyldord fjernet, uden at påtvinge en husstil.
Målingen
Teamet benchmarkede trinnet på 227 rigtige stemmeprøver, der dækkede engelsk, andre sprog og blandet sproginput. På den benchmark blev Gemma 4 E4B, der kører lokalt via Ollama på Apple Silicon, valgt som førstevalgsmodel. Median-latensen for finpudsnings-trinnet faldt fra 876 ms til 488 ms, hvilket siden beskriver som inden for det budget, teamet havde sat for et trin, der skal føles hurtigere end at skrive.
Omvendingen
Efter benchmarken blev arkitekturen vendt om: den lokale model blev standard og cloud-modellen fallback. Desktop-appen tjekker ved opstart, om Ollama kører; hvis den ikke gør, rutes finpudsnings-trinnet til en cloud-model, og dikteringen fortsætter.
Hvad der ændrede sig for brugerne, ifølge siden
- Diktering pr. bruger steg med omkring 30 procent på tværs af aktive betabrugere i de fire uger før og efter skiftet; brugere, der havde dikteret korte beskeder, begyndte at diktere længere.
- Den marginale inferensomkostning for trinnet faldt til nul, og siden angiver det som grunden til, at diktering er ubegrænset på alle niveauer, inklusive det gratis.
Grænsen for påstanden
Kun finpudsnings-trinnet blev flyttet. Transskription udføres af en cloud-tale-til-tekst-tjeneste før finpudsnings-trinnet, og Cues agenttilstand er afhængig af en cloud-model. Siden rapporterer tidlige evalueringer af Gemma 4's funktionskald til selvstændige agentopgaver og kalder dem tidlige. Vores hjemmeside siger derfor, at finpudsningen kører på brugerens maskine og siger intet om, at agenten kører lokalt; platformssiden registrerer den samme grænse.