Google DeepMinds casestudie om Cue er det eneste eksterne belegget om et av våre produkter, så den blir sitert, av oss og av andre. Dette innlegget legger frem hva siden sier, slik at sitatene kan sjekkes mot den. Siden er på deepmind.google/models/gemma/gemmaverse/cue-ai; tallene er merket som gjeldende per mai 2026.
Hva den målte
- Median-ventetiden for Cues finpuss-trinn for diktering falt fra 876 ms til 488 ms etter at trinnet flyttet fra en skymodell til Gemma 4 E4B som kjører lokalt gjennom Ollama. Siden kaller det en reduksjon på 44 prosent.
- Målingen ble gjort på Apple Silicon (M-serien) via Ollama, over en benchmark på 227 ekte taleopptak som dekker engelsk og flerspråklig input.
- Diktering per bruker økte med omtrent 30 prosent, målt på tvers av aktive betabrukere i de fire ukene før og etter at den lokale modellen ble standard.
- Den marginale inferenskostnaden for finpuss-trinnet falt til null, noe siden oppgir som grunnen til at diktering er ubegrenset på alle nivåer, inkludert gratisnivået.
Hva som kjører hvor, ifølge siden
- Brukeren holder inne en hurtigtast og snakker. Lyd transkriberes til råtekst av en skybasert tale-til-tekst-tjeneste.
- Råteksten sendes til Gemma 4 som kjører lokalt på brukerens maskin gjennom Ollama, med en system-prompt på omtrent 400 tokens som gjenoppretter tegnsetting, segmenterer setninger og fjerner fyllord.
- Hvis Ollama ikke kjører, oppdager skrivebordsappen det ved oppstart og ruter finpuss-steget til en skymodell.
- Cues agentmodus er avhengig av en skymodell. Siden rapporterer tidlige evalueringer av Gemma 4s funksjonskall for selvstendige oppgaver, og beskriver dem som tidlige.
Så «local» på den siden betyr ett trinn i én funksjon. Transkripsjon er skybasert, agenten er skybasert, og finpussen er lokal som standard med en skybasert reserveløsning.
Hvordan vi siterer den
Hjemmesiden bruker to tall fra den: 488 ms ned fra 876 ms, og setningen om at Cue er «a voice-activated AI agent that lives on the user's desktop.» Begge står på siden med disse ordene. Hjemmesiden viser også et 45-sekunders segment av en tale fra Gemma-teamet der taleren sier at engasjementet økte med 30 prosent; den skriftlige casestudien sier funksjonsbruk. Vi trykker det skriftlige tallet og bemerker forskjellen ved siden av segmentet.
Hva den ikke støtter
- Det er ikke en produktanmeldelse og kommer ikke med noen påstand om nøyaktigheten til transkripsjonen eller om agenten lykkes med oppgaver.
- Den 227-eksemplars benchmarken den beskriver, er privat for Cue og er ikke publisert. Vårt offentlige datasett, Voice Agent Benchmark Landscape, er noe annet: et kart over andres offentlige benchmarker, uten poengsummer.
- Tallene er datert mai 2026. En versjon av Cue utgitt etter denne datoen er ikke beskrevet på siden.
Siden med tall dokumenterer hvordan latenstallet brukes på hjemmesiden, og siden med belegg lister opp casestudien sammen med alt annet som er publisert om produktene våre.