De casestudy van Google DeepMind over Cue is het enige externe bewijs over een product van ons, dus wordt het vaak geciteerd, door ons en door anderen. Dit bericht legt uit wat de pagina zegt, zodat je de citaten kunt controleren. De pagina staat op deepmind.google/models/gemma/gemmaverse/cue-ai; de cijfers zijn actueel per mei 2026.
Wat het mat
- De mediane latentie van de opschoonstap van Cue's dicteerfunctie daalde van 876 ms naar 488 ms nadat de stap overging van een cloudmodel naar Gemma 4 E4B dat lokaal draait via Ollama. De pagina noemt dat een vermindering van 44 procent.
- De meting werd uitgevoerd op Apple Silicon (M-serie) via Ollama, met een benchmark van 227 echte spraakfragmenten die Engelse en meertalige invoer dekken.
- Het dicteergebruik per gebruiker steeg met ongeveer 30 procent, gemeten onder actieve bètatesters in de vier weken voor en na de invoering van het lokale model als standaard.
- De marginale inferentiekosten van de opschoonstap daalden tot nul, wat de pagina aangeeft als de reden waarom dicteren onbeperkt is in elk abonnement, inclusief het gratis abonnement.
Wat waar draait, volgens de pagina
- De gebruiker houdt een sneltoets ingedrukt en spreekt. Audio wordt door een spraak-naar-tekstservice in de cloud omgezet in onbewerkte tekst.
- De onbewerkte tekst wordt naar Gemma 4 gestuurd, dat lokaal op de machine van de gebruiker draait via Ollama, met een systeemprompt van ongeveer 400 tokens die interpunctie herstelt, zinnen segmenteert en stopwoorden verwijdert.
- Als Ollama niet draait, detecteert de desktop-app dat bij het opstarten en leidt de opschoonstap om naar een cloudmodel.
- De agentmodus van Cue is afhankelijk van een cloudmodel. De pagina rapporteert vroege evaluaties van Gemma 4's functieaanroepen voor opzichzelfstaande taken en beschrijft deze als voorlopig.
Dus “local” op die pagina betekent één stap van één functie. Transcriptie is cloud; de agent is cloud; het opschonen is standaard lokaal, met de cloud als terugvaloptie.
Hoe we het citeren
De startpagina gebruikt er twee cijfers uit: 488 ms, gedaald van 876 ms, en de zin dat Cue “a voice-activated AI agent that lives on the user's desktop.” is. Beide staan letterlijk zo op de pagina. De startpagina toont ook een segment van 45 seconden van een Gemma-teampresentatie waarin de spreker zegt dat de betrokkenheid met 30 procent steeg; de geschreven casestudy spreekt over functiegebruik. We vermelden het geschreven cijfer en noteren het verschil naast het segment.
Wat het niet ondersteunt
- Het is geen productrecensie en doet geen bewering over de nauwkeurigheid van de transcriptie of het succes van agenttaken.
- De benchmark van 227 fragmenten die het beschrijft, is privé voor Cue en wordt niet gepubliceerd. Onze openbare dataset, de Voice Agent Benchmark Landscape, is iets anders: een overzicht van openbare benchmarks van anderen, zonder scores.
- De cijfers dateren van mei 2026. Een versie van Cue die na die datum is uitgebracht, wordt niet door de pagina beschreven.
De pagina met cijfers legt vast hoe het latentiecijfer op de startpagina wordt gebruikt, en de pagina met bewijs somt de casestudy op naast al het andere dat over onze producten is gepubliceerd.