Het dicteren in Cue heeft een opschoonstap: het ruwe transcript, met stopwoordjes en ontbrekende leestekens, wordt omgezet in tekst die leest zoals de spreker het bedoelde. Waar die stap wordt uitgevoerd, is besloten op basis van een meting, en die meting is openbaar. Dit artikel volgt de casestudy van Google DeepMind, met cijfers van mei 2026, en voegt niets toe wat niet op die pagina staat.
Het oorspronkelijke ontwerp
De stap was gebouwd om een cloudmodel te gebruiken, met een lokaal model als terugvaloptie, in de veronderstelling dat een groter model nauwkeuriger zou opschonen. Het verklaarde doel van het team voor de stap was tekst die leest als de gebruiker in plaats van als een model: leestekens hersteld, zinnen gesegmenteerd, stopwoordjes verwijderd, zonder een huisstijl op te leggen.
De meting
Het team benchmarkte de stap op 227 echte spraakfragmenten in het Engels, andere talen en gemengde talen. Op basis van die benchmark werd Gemma 4 E4B, lokaal draaiend via Ollama op Apple Silicon, gekozen als het voorkeursmodel. De mediane latentie van de opschoonstap daalde van 876 ms naar 488 ms. Volgens de pagina valt dit binnen het budget dat het team had vastgesteld voor een stap die sneller moet aanvoelen dan typen.
De omkering
Na de benchmark werd de architectuur omgekeerd: het lokale model werd de standaard en het cloudmodel de terugvaloptie. De desktop-app controleert bij het opstarten of Ollama draait. Zo niet, dan wordt de opschoonstap doorgestuurd naar een cloudmodel en gaat het dicteren gewoon door.
Wat er volgens de pagina veranderde voor gebruikers
- Het dicteergebruik per gebruiker steeg met ongeveer 30 procent onder actieve bètatesters in de vier weken voor en na de omschakeling; gebruikers die voorheen korte berichten dicteerden, begonnen langere te dicteren.
- De marginale inferentiekosten van de stap daalden tot nul. De pagina geeft dit als reden waarom dicteren onbeperkt is in elk abonnement, inclusief het gratis abonnement.
De grenzen van de bewering
Alleen de opschoonstap is verplaatst. Transcriptie wordt vóór de opschoonstap gedaan door een spraak-naar-tekstservice in de cloud, en de agentmodus van Cue gebruikt een cloudmodel. De pagina vermeldt vroege evaluaties van de functieaanroepen van Gemma 4 voor opzichzelfstaande agenttaken en noemt deze voorlopig. Onze startpagina zegt daarom dat het opschonen op de machine van de gebruiker draait en zegt niets over de agent die lokaal draait; de platformpagina vermeldt dezelfde afbakening.