Blog

Ce spune și ce nu spune studiul de caz DeepMind despre Cue

Google DeepMind a publicat un studiu de caz despre Cue în 2026: ce a măsurat, ce rulează unde, cum îl cităm și afirmațiile pe care nu le susține.

Publicat la

Studiul de caz al Google DeepMind despre Cue este singura dovadă externă despre un produs al nostru, așa că este citat, de noi și de alții. Această postare prezintă ce spune pagina, astfel încât citatele să poată fi verificate în raport cu aceasta. Pagina se află la deepmind.google/models/gemma/gemmaverse/cue-ai; cifrele sale sunt marcate ca fiind actuale în mai 2026.

Ce a măsurat

  • Latența mediană a pasului de șlefuire a dictării din Cue a scăzut de la 876 ms la 488 ms după ce pasul a trecut de la un model în cloud la Gemma 4 E4B rulând local prin Ollama. Pagina numește aceasta o reducere de 44 la sută.
  • Măsurătoarea a fost efectuată pe Apple Silicon (seria M) prin Ollama, pe un benchmark de 227 de mostre vocale reale care acoperă limba engleză și intrări în mai multe limbi.
  • Dictarea per utilizator a crescut cu aproximativ 30 la sută, măsurată pe utilizatorii beta activi în cele patru săptămâni înainte și după ce modelul local a devenit implicit.
  • Costul marginal de inferență al pasului de șlefuire a scăzut la zero, ceea ce pagina indică drept motivul pentru care dictarea este nelimitată la fiecare nivel, inclusiv la cel gratuit.

Ce rulează unde, conform paginii

  • Utilizatorul ține apăsată o tastă rapidă și vorbește. Sunetul este transcris în text brut de un serviciu de conversie a vorbirii în text din cloud.
  • Textul brut este trimis către Gemma 4, care rulează local pe computerul utilizatorului prin Ollama, cu un prompt de sistem de aproximativ 400 de tokeni care restabilește punctuația, segmentează propozițiile și elimină cuvintele de umplutură.
  • Dacă Ollama nu rulează, aplicația desktop detectează acest lucru la pornire și direcționează pasul de șlefuire către un model cloud.
  • Modul agent al Cue se bazează pe un model cloud. Pagina raportează evaluări timpurii ale capacității de apelare a funcțiilor a Gemma 4 pentru sarcini autonome și le descrie ca fiind timpurii.

Așadar, „local” pe acea pagină înseamnă un singur pas al unei singure funcționalități. Transcrierea este în cloud; agentul este în cloud; șlefuirea este locală în mod implicit, cu o alternativă în cloud.

Cum îl cităm

Pagina de pornire folosește două cifre din acesta: 488 ms, în scădere de la 876 ms, și propoziția conform căreia Cue este „a voice-activated AI agent that lives on the user's desktop.” Ambele se află pe pagină în aceste cuvinte. Pagina de pornire arată, de asemenea, un segment de 45 de secunde dintr-o prezentare a echipei Gemma în care vorbitorul spune că implicarea a crescut cu 30 la sută; studiul de caz scris menționează utilizarea funcționalităților. Publicăm cifra scrisă și notăm diferența lângă segment.

Ce nu susține

  • Nu este o recenzie de produs și nu face nicio afirmație despre acuratețea transcrierii sau succesul sarcinilor agentului.
  • Benchmark-ul de 227 de eșantioane pe care îl descrie este privat pentru Cue și nu este publicat. Setul nostru de date public, Voice Agent Benchmark Landscape, este un lucru diferit: o hartă a benchmark-urilor publice ale altor persoane, fără scoruri.
  • Cifrele sale sunt datate mai 2026. O versiune a Cue lansată după acea dată nu este descrisă de pagină.

Pagina cu cifre înregistrează modul în care cifra de latență este utilizată pe pagina de pornire, iar pagina cu dovezi listează studiul de caz alături de tot ce s-a publicat despre produsele noastre.

Toate articolele