Emuārs

Ko DeepMind gadījuma izpēte saka par Cue un ko tā nesaka

Google DeepMind 2026. gadā publicēja gadījuma izpēti par Cue: ko tā mērīja, kas kur darbojas, kā mēs to citējam un apgalvojumi, ko tā neatbalsta.

Publicēts

Google DeepMind gadījuma izpēte par Cue ir vienīgais ārējais pierādījums par kādu no mūsu produktiem, tādēļ to citējam gan mēs, gan citi. Šajā rakstā ir izklāstīts, kas teikts lapā, lai citātus varētu pārbaudīt. Lapa atrodas adresē deepmind.google/models/gemma/gemmaverse/cue-ai; tās skaitļi ir atzīmēti kā aktuāli uz 2026. gada maiju.

Ko tā mērīja

  • Cue diktēšanas pieslīpēšanas soļa mediānas latentums samazinājās no 876 ms līdz 488 ms pēc tam, kad solis pārgāja no mākoņa modeļa uz Gemma 4 E4B, kas darbojas lokāli caur Ollama. Lapā tas tiek saukts par 44 procentu samazinājumu.
  • Mērījums tika veikts Apple Silicon (M sērijas) ierīcēs, izmantojot Ollama, ar benchmark, kas sastāvēja no 227 reāliem balss paraugiem, aptverot angļu valodu un jaukta valodu ievadi.
  • Diktēšanas apjoms uz vienu lietotāju pieauga par aptuveni 30 procentiem, mērot starp aktīviem beta versijas lietotājiem četrās nedēļās pirms un pēc tam, kad lokālais modelis kļuva par noklusējuma modeli.
  • Pieslīpēšanas soļa marginālās secināšanas izmaksas nokritās līdz nullei, ko lapa min kā iemeslu, kāpēc diktēšana ir neierobežota visos līmeņos, ieskaitot bezmaksas līmeni.

Kas kur darbojas, saskaņā ar lapu

  • Lietotājs tur nospiestu karsto taustiņu un runā. Audio tiek pārveidots neapstrādātā tekstā, izmantojot mākoņa runas-teksta pakalpojumu.
  • Neapstrādātais teksts tiek nosūtīts uz Gemma 4, kas darbojas lokāli lietotāja datorā caur Ollama, ar sistēmas uzvedni aptuveni 400 tokenu apjomā, kas atjauno pieturzīmes, segmentē teikumus un noņem liekvārdus.
  • Ja Ollama nedarbojas, datora lietotne to konstatē startēšanas laikā un novirza pieslīpēšanas soli uz mākoņa modeli.
  • Cue aģenta režīms paļaujas uz mākoņa modeli. Lapā ir ziņots par agrīniem Gemma 4 funkciju izsaukšanas novērtējumiem autonomiem uzdevumiem, un tie ir aprakstīti kā agrīni.

Tātad “local” tajā lapā nozīmē vienu vienas funkcijas soli. Transkripcija ir mākonī; aģents ir mākonī; pieslīpēšana pēc noklusējuma notiek lokāli ar mākoņa rezerves variantu.

Kā mēs to citējam

Sākumlapā tiek izmantoti divi skaitļi no tā: 488 ms, samazinājums no 876 ms, un teikums, ka Cue ir “a voice-activated AI agent that lives on the user's desktop.” Abi ir atrodami lapā ar šiem vārdiem. Sākumlapā ir redzams arī 45 sekunžu segments no Gemma komandas sarunas, kurā runātājs saka, ka iesaiste pieauga par 30 procentiem; rakstiskajā gadījuma izpētē ir minēta funkciju lietošana. Mēs publicējam rakstisko skaitli un norādām atšķirību blakus segmentam.

Ko tas neatbalsta

  • Tā nav produkta atsauksme un nesatur apgalvojumus par transkripcijas precizitāti vai aģenta uzdevumu veiksmīgumu.
  • Tajā aprakstītais 227 paraugu benchmark ir Cue privāts un nav publicēts. Mūsu publiskā datu kopa, Voice Agent Benchmark Landscape, ir kas cits: citu cilvēku publisko benchmark apkopojums bez rezultātiem.
  • Tās skaitļi ir datēti ar 2026. gada maiju. Cue versija, kas izdota pēc šī datuma, nav aprakstīta šajā lapā.

Lapa “Skaitļi” reģistrē, kā latentuma skaitlis tiek izmantots sākumlapā, un lapa “Pierādījumi” uzskaita gadījuma izpēti līdzās visam pārējam, kas ir publicēts par mūsu produktiem.

Visi raksti