A Google DeepMind esettanulmánya a Cue-ról az egyetlen külső bizonyíték az egyik termékünkről, ezért idézik, mi is és mások is. Ez a bejegyzés ismerteti, mit állít az oldal, hogy az idézetek ellenőrizhetők legyenek. Az oldal a deepmind.google/models/gemma/gemmaverse/cue-ai címen érhető el; az adatai 2026. májusi állapotot tükröznek.
Mit mértek
- A Cue diktálási csiszolás lépésének medián késleltetése 876 ms-ról 488 ms-ra csökkent, miután a lépés egy felhőalapú modellről egy helyben, az Ollama-n keresztül futó Gemma 4 E4B-re váltott. Az oldal ezt 44 százalékos csökkenésnek nevezi.
- A mérést Apple Silicon (M-szériás) eszközön végezték az Ollama-n keresztül, egy 227 valós hangmintából álló benchmark alapján, amely angol és vegyes nyelvű bemenetet is tartalmazott.
- A felhasználónkénti diktálás körülbelül 30 százalékkal nőtt, a helyi modell alapértelmezetté válása előtti és utáni négy hétben az aktív béta-felhasználók körében mérve.
- A csiszolási lépés marginális következtetési költsége nullára csökkent, amit az oldal azzal indokol, hogy a diktálás minden szinten korlátlan, beleértve az ingyeneset is.
Mi hol fut az oldal szerint
- A felhasználó lenyomva tart egy billentyűparancsot és beszél. A hangot egy felhőalapú beszédfelismerő szolgáltatás alakítja nyers szöveggé.
- A nyers szöveg a felhasználó gépén helyben, az Ollama-n keresztül futó Gemma 4-hez kerül, egy körülbelül 400 tokenes rendszerprompt kíséretében, amely helyreállítja az írásjeleket, mondatokra tagolja a szöveget és eltávolítja a töltelékszavakat.
- Ha az Ollama nem fut, az asztali alkalmazás ezt indításkor észleli, és a csiszolás lépését egy felhőalapú modellhez irányítja.
- A Cue ágensmódja felhőalapú modellen alapul. Az oldal a Gemma 4 funkcióhívásának korai kiértékeléseiről számol be önálló feladatok esetében, és ezeket korainak nevezi.
Tehát a „local” azon az oldalon egy funkció egy lépését jelenti. Az átírás felhőalapú; az ágens felhőalapú; a csiszolás alapértelmezetten helyi, felhőalapú tartalékkal.
Hogyan idézzük
A főoldal két számot használ belőle: 488 ms, a korábbi 876 ms-ról, és a mondatot, miszerint a Cue „a voice-activated AI agent that lives on the user's desktop.” Mindkettő ezekkel a szavakkal szerepel az oldalon. A főoldal egy 45 másodperces részletet is mutat egy Gemma-csapatmegbeszélésből, amelyben a felszólaló azt mondja, hogy az elköteleződés 30 százalékkal nőtt; az írott esettanulmány a funkcióhasználatot említi. Az írott számot közöljük, és a részlet mellett jelezzük a különbséget.
Amit nem támaszt alá
- Ez nem termékvélemény, és nem tesz állítást az átiratírás pontosságáról vagy az ágens feladatvégrehajtásának sikerességéről.
- Az általa leírt 227 mintából álló benchmark a Cue magántulajdona, és nem publikus. A mi nyilvános adatkészletünk, a Voice Agent Benchmark Landscape más: mások nyilvános benchmarkjainak térképe, pontszámok nélkül.
- A benne szereplő számok 2026. májusi keltezésűek. Az oldal nem írja le a Cue ezen dátum után kiadott verzióját.
A számok oldala rögzíti, hogyan használjuk a késleltetési számot a főoldalon, a bizonyítékok oldala pedig felsorolja az esettanulmányt minden egyéb mellett, ami a termékeinkről megjelent.