Il caso di studio di Google DeepMind su Cue è l’unica prova esterna su un nostro prodotto, quindi viene citato, da noi e da altri. Questo post espone cosa dice la pagina, in modo che le citazioni possano essere verificate. La pagina si trova su deepmind.google/models/gemma/gemmaverse/cue-ai; le sue cifre sono indicate come aggiornate a maggio 2026.
Cosa ha misurato
- La latenza mediana del passaggio di rifinitura della dettatura di Cue è scesa da 876 ms a 488 ms dopo che il passaggio è stato spostato da un modello cloud a Gemma 4 E4B eseguito localmente tramite Ollama. La pagina definisce questa una riduzione del 44%.
- La misurazione è stata effettuata su Apple Silicon (serie M) tramite Ollama, su un benchmark di 227 campioni vocali reali che coprono input in inglese e in più lingue.
- La dettatura per utente è aumentata di circa il 30%, misurata tra gli utenti beta attivi nelle quattro settimane prima e dopo che il modello locale è diventato predefinito.
- Il costo marginale di inferenza del passaggio di rifinitura è sceso a zero, che la pagina indica come motivo per cui la dettatura è illimitata in ogni piano, compreso quello gratuito.
Cosa viene eseguito e dove, secondo la pagina
- L’utente tiene premuta una scorciatoia da tastiera e parla. L’audio viene trascritto in testo grezzo da un servizio cloud di riconoscimento vocale.
- Il testo grezzo viene inviato a Gemma 4, in esecuzione locale sul computer dell’utente tramite Ollama, con un prompt di sistema di circa 400 token che ripristina la punteggiatura, segmenta le frasi e rimuove le parole di riempimento.
- Se Ollama non è in esecuzione, l’applicazione desktop lo rileva all’avvio e instrada il passaggio di rifinitura a un modello cloud.
- La modalità agente di Cue si basa su un modello cloud. La pagina riporta le prime valutazioni sull’uso del function calling di Gemma 4 per attività autonome e le descrive come iniziali.
Quindi, su quella pagina, “locale” significa un passaggio di una funzionalità. La trascrizione è cloud; l’agente è cloud; la rifinitura è locale per impostazione predefinita, con un fallback su cloud.
Come lo citiamo
La home page ne utilizza due cifre: da 876 ms a 488 ms, e la frase secondo cui Cue è “a voice-activated AI agent that lives on the user's desktop.” Entrambe compaiono sulla pagina con queste parole. La home page mostra anche un segmento di 45 secondi di un intervento del team di Gemma in cui l’oratore afferma che il coinvolgimento è aumentato del 30 percento; il case study scritto parla di utilizzo delle funzionalità. Riportiamo la cifra scritta e notiamo la differenza accanto al segmento.
Cosa non supporta
- Non è una recensione di prodotto e non fa affermazioni sull’accuratezza della trascrizione o sul successo delle attività dell’agente.
- Il benchmark da 227 campioni che descrive è privato di Cue e non è pubblicato. Il nostro dataset pubblico, il Voice Agent Benchmark Landscape, è una cosa diversa: una mappa dei benchmark pubblici di altri, senza punteggi.
- Le sue cifre sono datate maggio 2026. Una versione di Cue rilasciata dopo tale data non è descritta dalla pagina.
La pagina delle cifre registra come il dato sulla latenza viene usato nella home page, e la pagina delle prove elenca il case study accanto a tutto il resto che è stato pubblicato sui nostri prodotti.