Blog

Wat die DeepMind-gevallestudie oor Cue sê, en wat dit nie sê nie

Google DeepMind het in 2026 'n gevallestudie oor Cue gepubliseer: wat dit gemeet het, wat waar loop, hoe ons dit aanhaal, en die bewerings wat dit nie ondersteun nie.

Gepubliseer

Google DeepMind se gevallestudie oor Cue is die een stuk eksterne bewys oor 'n produk van ons, so dit word aangehaal, deur ons en deur ander. Hierdie plasing sit uiteen wat die blad sê, sodat die aanhalings daarteen gekontroleer kan word. Die blad is by deepmind.google/models/gemma/gemmaverse/cue-ai; sy syfers word as huidig soos van Mei 2026 gemerk.

Wat dit gemeet het

  • Die mediaanlatensie van Cue se diktee-afrondingstap het van 876 ms tot 488 ms gedaal nadat die stap van 'n wolkmodel na Gemma 4 E4B geskuif het wat plaaslik deur Ollama loop. Die blad noem dit 'n vermindering van 44 persent.
  • Die meting is op Apple Silicon (M-reeks) via Ollama gedoen, oor 'n benchmark van 227 regte stemmonsters wat Engelse en gemengde-taal-invoer dek.
  • Diktee per gebruiker het met sowat 30 persent gestyg, gemeet oor aktiewe beta-gebruikers in die vier weke voor en na die plaaslike model die verstek geword het.
  • Die marginale inferensiekoste van die afrondingstap het tot nul gedaal, wat die blad aangee as die rede hoekom diktee onbeperk is op elke vlak, insluitend die gratis een.

Wat waar loop, volgens die blad

  • Die gebruiker hou 'n snelsleutel in en praat. Oudio word na rou teks getranskribeer deur 'n wolk-spraak-na-teks-diens.
  • Die rou teks word na Gemma 4 gestuur wat plaaslik op die gebruiker se masjien deur Ollama loop, met 'n stelselopdrag van sowat 400 tokens wat leestekens herstel, sinne segmenteer en stopwoorde verwyder.
  • As Ollama nie loop nie, bespeur die rekenaartoepassing dit by opstart en stuur die afrondingstap na 'n wolkmodel.
  • Cue se agentmodus maak op 'n wolkmodel staat. Die blad rapporteer vroeë evaluerings van Gemma 4 se funksie-oproepe vir selfstandige take, en beskryf hulle as vroeg.

So “local” op daardie bladsy beteken een stap van een funksie. Transkripsie is wolkgebaseer; die agent is wolkgebaseer; die afronding is plaaslik by verstek met 'n wolk-terugvalopsie.

Hoe ons dit aanhaal

Die tuisblad gebruik twee syfers daaruit: 488 ms af van 876 ms, en die sin dat Cue “a voice-activated AI agent that lives on the user's desktop.” is. Albei verskyn in daardie woorde op die blad. Die tuisblad wys ook 'n segment van 45 sekondes van 'n Gemma-spanpraatjie waarin die spreker sê betrokkenheid het met 30 persent gestyg; die geskrewe gevallestudie sê funksiegebruik. Ons druk die geskrewe syfer en let op die verskil langs die segment.

Wat dit nie ondersteun nie

  • Dit is nie 'n produkresensie nie en maak geen bewering oor transkripsie-akkuraatheid of die sukses van agenttake nie.
  • Die benchmark van 227 monsters wat dit beskryf, is privaat vir Cue en word nie gepubliseer nie. Ons openbare datastel, die Voice Agent Benchmark Landscape, is iets anders: 'n kaart van ander mense se openbare benchmarks, met geen tellings nie.
  • Die syfers daarin is gedateer Mei 2026. 'n Weergawe van Cue wat na daardie datum vrygestel is, word nie deur die blad beskryf nie.

Die syferblad teken aan hoe die latensiesyfer op die tuisblad gebruik word, en die bewysblad lys die gevallestudie saam met alles anders wat oor ons produkte gepubliseer is.

Alle plasings