Blogi

Mida DeepMindi juhtumiuuring Cue kohta ütleb ja mida mitte

Google DeepMind avaldas 2026. aastal Cue kohta juhtumiuuringu: mida mõõdeti, mis kus töötab, kuidas me seda tsiteerime ja väited, mida see ei toeta.

Avaldatud

Google DeepMindi juhtumiuuring Cue kohta on ainus väline tõend meie toote kohta, seega tsiteeritakse seda nii meie kui ka teiste poolt. See postitus selgitab, mida leht ütleb, et tsitaate saaks sellega võrrelda. Leht asub aadressil deepmind.google/models/gemma/gemmaverse/cue-ai; selle arvud on märgitud kehtivaks seisuga mai 2026.

Mida mõõdeti

  • Cue dikteerimise viimistluse sammu mediaanlatentsus langes 876 ms-lt 488 ms-le pärast seda, kui samm viidi pilvemudelilt üle kohalikult Ollama kaudu töötavale Gemma 4 E4B-le. Leht nimetab seda 44-protsendiliseks vähenemiseks.
  • Mõõtmine tehti Apple Siliconil (M-seeria) Ollama kaudu, kasutades 227 reaalsest häälenäidisest koosnevat benchmark'i, mis hõlmas ingliskeelset ja segakeelset sisendit.
  • Dikteerimine kasutaja kohta kasvas umbes 30 protsenti, mõõdetuna aktiivsete beetakasutajate seas nelja nädala jooksul enne ja pärast kohaliku mudeli vaikimisi kasutuselevõttu.
  • Viimistluse sammu marginaalne järelduskulu langes nullini, mida leht toob põhjuseks, miks dikteerimine on piiramatu igal tasemel, sealhulgas tasuta tasemel.

Mis kus töötab, vastavalt lehele

  • Kasutaja hoiab all kiirklahvi ja räägib. Heli transkribeeritakse toortekstiks pilvepõhise kõnetuvastusteenuse abil.
  • Toortekst saadetakse kasutaja masinas Ollama kaudu kohalikult töötavale Gemma 4-le koos umbes 400-märgilise süsteemiviibaga, mis taastab kirjavahemärgid, segmenteerib laused ja eemaldab täitesõnad.
  • Kui Ollama ei tööta, tuvastab töölauarakendus selle käivitamisel ja suunab viimistlusetapi pilvemudelile.
  • Cue agendirežiim tugineb pilvemudelile. Lehel on juttu Gemma 4 funktsioonikutsete varastest hindamistest eraldiseisvate ülesannete jaoks ja kirjeldatakse neid kui varaseid.

Seega tähendab „local“ sellel lehel ühe funktsiooni ühte sammu. Transkriptsioon on pilvepõhine; agent on pilvepõhine; viimistlus on vaikimisi lokaalne, pilvepõhise varuvariandiga.

Kuidas me seda tsiteerime

Avalehel kasutatakse sellest kahte arvu: 488 ms, mis on langus 876 ms-lt, ja lauset, et Cue on „a voice-activated AI agent that lives on the user's desktop.” Mõlemad on lehel täpselt sellisel kujul. Avalehel näidatakse ka 45-sekundilist lõiku Gemma meeskonna ettekandest, kus esineja ütleb, et kaasatus kasvas 30 protsenti; kirjalik juhtumiuuring ütleb funktsioonide kasutus. Me kasutame kirjalikku arvu ja märgime erinevuse lõigu juures ära.

Mida see ei toeta

  • See ei ole toote arvustus ega esita väiteid transkriptsiooni täpsuse või agendi ülesannete edukuse kohta.
  • Selles kirjeldatud 227 näidisega benchmark on Cue siseasi ja seda ei avaldata. Meie avalik andmestik, Voice Agent Benchmark Landscape, on midagi muud: kaart teiste inimeste avalikest benchmark’idest, ilma skoorideta.
  • Selle arvud pärinevad maist 2026. Lehekülg ei kirjelda Cue versiooni, mis on välja antud pärast seda kuupäeva.

Arvude lehel on kirjas, kuidas latentsusaja arvu avalehel kasutatakse, ja tõendite lehel on juhtumiuuring loetletud kõige muu kõrval, mis meie toodete kohta on avaldatud.

Kõik postitused