La dettatura di Cue ha una fase di rifinitura: la trascrizione grezza, con le sue parole di riempimento e la punteggiatura mancante, viene trasformata in un testo che si legge come intendeva chi parlava. Dove eseguire questa fase è stato deciso da una misurazione, e la misurazione è pubblica. Questo articolo segue il caso di studio di Google DeepMind, con cifre aggiornate a maggio 2026, e non aggiunge nulla che la pagina non dichiari.
Il progetto originale
La fase era stata costruita per usare un modello cloud, con un modello locale come ripiego, partendo dal presupposto che un modello più grande avrebbe eseguito una rifinitura più accurata. L’obiettivo dichiarato del team per questa fase era un testo che rispecchiasse l’utente anziché un modello: punteggiatura ripristinata, frasi segmentate, riempitivi rimossi, senza imporre uno stile della casa.
La misurazione
Il team ha eseguito un benchmark della fase su 227 campioni vocali reali che coprivano inglese, altre lingue e input multilingue. Su quel benchmark, Gemma 4 E4B, eseguito in locale tramite Ollama su Apple Silicon, è stato scelto come modello di prima scelta. La latenza mediana della fase di rifinitura è scesa da 876 ms a 488 ms, una cifra che la pagina descrive come entro il budget che il team aveva fissato per una fase che deve sembrare più veloce della digitazione.
L’inversione
Dopo il benchmark, l’architettura è stata invertita: il modello locale è diventato quello predefinito e il modello cloud il ripiego. L’app desktop controlla all’avvio se Ollama è in esecuzione; in caso contrario, la fase di rifinitura viene instradata a un modello cloud e la dettatura continua.
Cosa è cambiato per gli utenti, secondo la pagina
- La dettatura per utente è aumentata di circa il 30 percento tra gli utenti beta attivi nelle quattro settimane prima e dopo il passaggio; gli utenti che avevano dettato messaggi brevi hanno iniziato a dettarne di più lunghi.
- Il costo marginale di inferenza della fase è sceso a zero, e la pagina indica questo come il motivo per cui la dettatura è illimitata in ogni piano, compreso quello gratuito.
I limiti dell’affermazione
Solo la fase di rifinitura è stata spostata. La trascrizione viene eseguita da un servizio di riconoscimento vocale cloud prima della fase di rifinitura, e la modalità agente di Cue si basa su un modello cloud. La pagina riporta le prime valutazioni del function calling di Gemma 4 per compiti di agente autonomi e le definisce preliminari. La nostra home page afferma quindi che la rifinitura viene eseguita sulla macchina dell’utente e non dice nulla sull’esecuzione dell’agente in locale; la pagina delle piattaforme riporta lo stesso limite.