Google DeepMinds fallstudie om Cue är det enda externa belägget om en av våra produkter, så den citeras, av oss och av andra. Detta inlägg redogör för vad sidan säger, så att citaten kan kontrolleras mot den. Sidan finns på deepmind.google/models/gemma/gemmaverse/cue-ai; dess siffror är markerade som aktuella per maj 2026.
Vad den mätte
- Medianlatensen för Cues putsningssteg för diktering sjönk från 876 ms till 488 ms efter att steget flyttades från en molnmodell till Gemma 4 E4B som körs lokalt via Ollama. Sidan kallar det en minskning med 44 procent.
- Mätningen gjordes på Apple Silicon (M-serien) via Ollama, över en benchmark med 227 verkliga röstprover som täcker engelska och blandat språk.
- Diktering per användare ökade med cirka 30 procent, mätt över aktiva betaanvändare under de fyra veckorna före och efter att den lokala modellen blev standard.
- Marginalkostnaden för inferens för putsningssteget sjönk till noll, vilket sidan anger som anledningen till att diktering är obegränsad på alla nivåer, inklusive den kostnadsfria.
Vad som körs var, enligt sidan
- Användaren håller nere ett kortkommando och talar. Ljud transkriberas till råtext av en molnbaserad tal-till-text-tjänst.
- Råtexten skickas till Gemma 4 som körs lokalt på användarens dator via Ollama, med en systemprompt på cirka 400 tokens som återställer skiljetecken, segmenterar meningar och tar bort utfyllnadsord.
- Om Ollama inte körs upptäcker datorappen det vid start och skickar putsningssteget till en molnmodell.
- Cues agentläge använder en molnmodell. Sidan rapporterar tidiga utvärderingar av Gemma 4:s funktionsanrop för fristående uppgifter och beskriver dem som tidiga.
Så ”local” på den sidan betyder ett steg i en funktion. Transkription är molnbaserad, agenten är molnbaserad och putsningen är lokal som standard med en molnbaserad reservlösning.
Hur vi citerar den
Hemsidan använder två siffror från den: 488 ms, en minskning från 876 ms, och meningen att Cue är ”a voice-activated AI agent that lives on the user's desktop.” Båda finns på sidan med exakt de orden. Hemsidan visar också ett 45-sekunders klipp från ett föredrag av Gemma-teamet där talaren säger att engagemanget ökade med 30 procent; den skriftliga fallstudien säger funktionsanvändning. Vi återger den skriftliga siffran och noterar skillnaden bredvid klippet.
Vad den inte stöder
- Det är inte en produktrecension och gör inget påstående om transkriptionens korrekthet eller agentens framgång med uppgifter.
- Den benchmark med 227 exempel som den beskriver är privat för Cue och publiceras inte. Vår offentliga datauppsättning, Voice Agent Benchmark Landscape, är något annat: en karta över andras offentliga benchmarks, utan poäng.
- Siffrorna är från maj 2026. En version av Cue som släpptes efter det datumet beskrivs inte på sidan.
Sidan med siffror dokumenterar hur latenssiffran används på hemsidan, och sidan med belägg listar fallstudien tillsammans med allt annat som har publicerats om våra produkter.