Blog

Hvad casestudiet fra DeepMind siger om Cue, og hvad det ikke gør

Google DeepMind udgav et casestudie om Cue i 2026: hvad det målte, hvad der kører hvor, hvordan vi citerer det, og de påstande, det ikke understøtter.

Udgivet

Google DeepMinds casestudie om Cue er det eneste stykke eksternt belæg for et af vores produkter, så det bliver citeret, af os og af andre. Dette indlæg beskriver, hvad siden siger, så citaterne kan tjekkes op imod den. Siden findes på deepmind.google/models/gemma/gemmaverse/cue-ai; dens tal er markeret som aktuelle pr. maj 2026.

Hvad det målte

  • Medianlatenstiden for Cues finpudsnings-trin for diktering faldt fra 876 ms til 488 ms, efter at trinnet flyttede fra en skymodel til Gemma 4 E4B, der kører lokalt gennem Ollama. Siden kalder det en reduktion på 44 procent.
  • Målingen blev foretaget på Apple Silicon (M-serien) via Ollama over en benchmark på 227 rigtige stemmeprøver, der dækkede engelsk og blandet sproginput.
  • Diktering pr. bruger steg med omkring 30 procent, målt på tværs af aktive betabrugere i de fire uger før og efter, at den lokale model blev standard.
  • Den marginale inferensomkostning for finpudsnings-trinnet faldt til nul, hvilket siden angiver som grunden til, at diktering er ubegrænset på alle niveauer, inklusive det gratis.

Hvad der kører hvor, ifølge siden

  • Brugeren holder en genvejstast nede og taler. Lyd transskriberes til rå tekst af en skybaseret tale-til-tekst-tjeneste.
  • Den rå tekst sendes til Gemma 4, der kører lokalt på brugerens maskine gennem Ollama, med en systemprompt på omkring 400 tokens, der gendanner tegnsætning, segmenterer sætninger og fjerner fyldord.
  • Hvis Ollama ikke kører, opdager desktop-appen det ved opstart og omdirigerer finpudsningen til en cloud-model.
  • Cues agenttilstand bruger en cloud-model. Siden rapporterer tidlige evalueringer af Gemma 4's funktionskald til selvstændige opgaver og beskriver dem som tidlige.

Så “local” på den side betyder ét trin af én funktion. Transskription er cloud; agenten er cloud; finpudsning er lokal som standard med en cloud-fallback.

Hvordan vi citerer den

Hjemmesiden bruger to tal fra den: 488 ms ned fra 876 ms og sætningen om, at Cue er »a voice-activated AI agent that lives on the user's desktop.« Begge findes på siden med de ord. Hjemmesiden viser også et 45-sekunders segment af en tale fra Gemma-teamet, hvor taleren siger, at engagementet steg med 30 procent; den skriftlige casestudie siger brug af funktioner. Vi bruger det skriftlige tal og bemærker forskellen ved siden af segmentet.

Hvad den ikke understøtter

  • Det er ikke en produktanmeldelse og fremsætter ingen påstande om nøjagtigheden af transskription eller succesraten for agentopgaver.
  • Den benchmark med 227 prøver, som den beskriver, er privat for Cue og er ikke offentliggjort. Vores offentlige datasæt, Voice Agent Benchmark Landscape, er noget andet: et kort over andres offentlige benchmarks, uden scorer.
  • Dens tal er dateret maj 2026. En version af Cue udgivet efter den dato er ikke beskrevet på siden.

Siden med tal registrerer, hvordan latenstallet bruges på hjemmesiden, og siden med belæg lister casestudiet sammen med alt andet, der er blevet offentliggjort om vores produkter.

Alle indlæg