Blog

Mit mond a DeepMind esettanulmány a Cue-ról, és mit nem

A Google DeepMind 2026-ban esettanulmányt tett közzé a Cue-ról: mit mértek, mi hol fut, hogyan idézzük, és mely állításokat nem támasztja alá.

Közzétéve:

A Google DeepMind esettanulmánya a Cue-ról az egyetlen külső bizonyíték az egyik termékünkről, ezért idézik, mi is és mások is. Ez a bejegyzés ismerteti, mit állít az oldal, hogy az idézetek ellenőrizhetők legyenek. Az oldal a deepmind.google/models/gemma/gemmaverse/cue-ai címen érhető el; az adatai 2026. májusi állapotot tükröznek.

Mit mértek

  • A Cue diktálási csiszolás lépésének medián késleltetése 876 ms-ról 488 ms-ra csökkent, miután a lépés egy felhőalapú modellről egy helyben, az Ollama-n keresztül futó Gemma 4 E4B-re váltott. Az oldal ezt 44 százalékos csökkenésnek nevezi.
  • A mérést Apple Silicon (M-szériás) eszközön végezték az Ollama-n keresztül, egy 227 valós hangmintából álló benchmark alapján, amely angol és vegyes nyelvű bemenetet is tartalmazott.
  • A felhasználónkénti diktálás körülbelül 30 százalékkal nőtt, a helyi modell alapértelmezetté válása előtti és utáni négy hétben az aktív béta-felhasználók körében mérve.
  • A csiszolási lépés marginális következtetési költsége nullára csökkent, amit az oldal azzal indokol, hogy a diktálás minden szinten korlátlan, beleértve az ingyeneset is.

Mi hol fut az oldal szerint

  • A felhasználó lenyomva tart egy billentyűparancsot és beszél. A hangot egy felhőalapú beszédfelismerő szolgáltatás alakítja nyers szöveggé.
  • A nyers szöveg a felhasználó gépén helyben, az Ollama-n keresztül futó Gemma 4-hez kerül, egy körülbelül 400 tokenes rendszerprompt kíséretében, amely helyreállítja az írásjeleket, mondatokra tagolja a szöveget és eltávolítja a töltelékszavakat.
  • Ha az Ollama nem fut, az asztali alkalmazás ezt indításkor észleli, és a csiszolás lépését egy felhőalapú modellhez irányítja.
  • A Cue ágensmódja felhőalapú modellen alapul. Az oldal a Gemma 4 funkcióhívásának korai kiértékeléseiről számol be önálló feladatok esetében, és ezeket korainak nevezi.

Tehát a „local” azon az oldalon egy funkció egy lépését jelenti. Az átírás felhőalapú; az ágens felhőalapú; a csiszolás alapértelmezetten helyi, felhőalapú tartalékkal.

Hogyan idézzük

A főoldal két számot használ belőle: 488 ms, a korábbi 876 ms-ról, és a mondatot, miszerint a Cue „a voice-activated AI agent that lives on the user's desktop.” Mindkettő ezekkel a szavakkal szerepel az oldalon. A főoldal egy 45 másodperces részletet is mutat egy Gemma-csapatmegbeszélésből, amelyben a felszólaló azt mondja, hogy az elköteleződés 30 százalékkal nőtt; az írott esettanulmány a funkcióhasználatot említi. Az írott számot közöljük, és a részlet mellett jelezzük a különbséget.

Amit nem támaszt alá

  • Ez nem termékvélemény, és nem tesz állítást az átiratírás pontosságáról vagy az ágens feladatvégrehajtásának sikerességéről.
  • Az általa leírt 227 mintából álló benchmark a Cue magántulajdona, és nem publikus. A mi nyilvános adatkészletünk, a Voice Agent Benchmark Landscape más: mások nyilvános benchmarkjainak térképe, pontszámok nélkül.
  • A benne szereplő számok 2026. májusi keltezésűek. Az oldal nem írja le a Cue ezen dátum után kiadott verzióját.

A számok oldala rögzíti, hogyan használjuk a késleltetési számot a főoldalon, a bizonyítékok oldala pedig felsorolja az esettanulmányt minden egyéb mellett, ami a termékeinkről megjelent.

Minden bejegyzés