L’estudi de cas de Google DeepMind sobre Cue és l’única prova externa sobre un producte nostre, així que se cita, per nosaltres i per altres. Aquesta entrada exposa què diu la pàgina, perquè les cites es puguin comprovar. La pàgina és a deepmind.google/models/gemma/gemmaverse/cue-ai; les seves xifres s’indiquen com a actuals a maig de 2026.
Què va mesurar
- La mediana de latència del pas de polit del dictat de Cue va baixar de 876 ms a 488 ms després que el pas es mogués d’un model al núvol a Gemma 4 E4B executant-se localment a través d’Ollama. La pàgina anomena això una reducció del 44 per cent.
- El mesurament es va fer en un Apple Silicon (sèrie M) mitjançant Ollama, sobre un benchmark de 227 mostres de veu reals que cobrien entrades en anglès i en diversos idiomes.
- El dictat per usuari va augmentar aproximadament un 30 per cent, mesurat entre els usuaris actius de la beta en les quatre setmanes abans i després que el model local es convertís en el predeterminat.
- El cost marginal d’inferència del pas de polit va caure a zero, cosa que la pàgina addueix com la raó per la qual el dictat és il·limitat en tots els nivells, inclòs el gratuït.
Què s’executa on, segons la pàgina
- L’usuari manté premuda una drecera de teclat i parla. L’àudio es transcriu a text en brut mitjançant un servei de veu a text al núvol.
- El text en brut s’envia a Gemma 4, que s’executa localment a la màquina de l’usuari a través d’Ollama, amb una indicació de sistema d’uns 400 fitxes que restaura la puntuació, segmenta les frases i elimina les paraules de farciment.
- Si Ollama no s’està executant, l’aplicació d’escriptori ho detecta en iniciar-se i envia el pas de polit a un model al núvol.
- El mode agent de Cue depèn d’un model al núvol. La pàgina informa de les primeres avaluacions de la crida de funcions de Gemma 4 per a tasques autònomes i les descriu com a primerenques.
Així, «local» en aquesta pàgina significa un pas d’una funcionalitat. La transcripció és al núvol; l’agent és al núvol; el polit és local per defecte, amb una alternativa al núvol.
Com el citem
La pàgina d’inici n’utilitza dues xifres: 488 ms, una reducció des de 876 ms, i la frase que diu que Cue és “a voice-activated AI agent that lives on the user's desktop.” Totes dues apareixen a la pàgina amb aquestes paraules. La pàgina d’inici també mostra un segment de 45 segons d’una xerrada de l’equip de Gemma en què l’orador diu que la interacció va augmentar un 30 per cent; l’estudi de cas escrit diu l’ús de la funcionalitat. Imprimim la xifra escrita i anotem la diferència al costat del segment.
Què no admet
- No és una ressenya de producte i no fa cap afirmació sobre la precisió de la transcripció o l’èxit de les tasques de l’agent.
- El benchmark de 227 mostres que descriu és privat de Cue i no està publicat. El nostre conjunt de dades públic, el Voice Agent Benchmark Landscape, és una cosa diferent: un mapa dels benchmarks públics d’altres, sense puntuacions.
- Les seves xifres estan datades el maig de 2026. Una versió de Cue publicada després d’aquesta data no està descrita a la pàgina.
La pàgina de xifres registra com s’utilitza el número de latència a la pàgina d’inici, i la pàgina de proves enumera l’estudi de cas al costat de tota la resta que s’ha publicat sobre els nostres productes.