Blog

Kung ano ang sinasabi ng case study ng DeepMind tungkol sa Cue, at kung ano ang hindi

Naglabas ang Google DeepMind ng isang case study tungkol sa Cue noong 2026: kung ano ang sinukat nito, kung ano ang tumatakbo at saan, paano namin ito sinisipi, at ang mga pahayag na hindi nito sinusuportahan.

Inilathala noong

Ang case study ng Google DeepMind tungkol sa Cue ang nag-iisang patunay mula sa labas tungkol sa isang produkto namin, kaya sinisipi ito, namin at ng iba. Inilalatag ng post na ito kung ano ang sinasabi ng pahina, para masuri ang mga sipi laban dito. Nasa deepmind.google/models/gemma/gemmaverse/cue-ai ang pahina; ang mga numero nito ay minarkahang current noong Mayo 2026.

Ano ang sinukat nito

  • Bumaba ang median latency ng hakbang sa pagpapakinis ng idiniktang teksto ng Cue mula 876 ms patungong 488 ms matapos ilipat ang hakbang mula sa isang cloud model patungo sa Gemma 4 E4B na lokal na tumatakbo sa pamamagitan ng Ollama. Tinatawag iyon ng pahina na isang 44 porsiyentong pagbaba.
  • Kinuha ang pagsukat sa Apple Silicon (M-series) sa pamamagitan ng Ollama, gamit ang isang benchmark ng 227 totoong voice sample na sumasaklaw sa English at mixed-language na input.
  • Tumaas nang humigit-kumulang 30 porsiyento ang pagdidikta bawat user, na sinukat sa mga aktibong beta user sa loob ng apat na linggo bago at pagkatapos maging default ang lokal na model.
  • Bumaba sa zero ang marginal inference cost ng hakbang sa pagpapakinis, na ayon sa pahina ay ang dahilan kung bakit walang limitasyon ang pagdidikta sa bawat tier, kasama na ang libre.

Ano ang tumatakbo at saan, ayon sa pahina

  • Pinipindot ng user ang isang hotkey at nagsasalita. Tina-transcribe ang audio sa raw text ng isang cloud speech-to-text service.
  • Ipinapadala ang raw text sa Gemma 4 na lokal na tumatakbo sa machine ng user sa pamamagitan ng Ollama, na may system prompt na humigit-kumulang 400 token na nagbabalik ng bantas, naghahati ng mga pangungusap, at nag-aalis ng mga filler word.
  • Kung hindi tumatakbo ang Ollama, nade-detect iyan ng desktop app sa startup at iniruruta ang hakbang na polish sa isang cloud model.
  • Umaasa ang agent mode ng Cue sa isang cloud model. Iniuulat ng page ang mga paunang pagsusuri sa function calling ng Gemma 4 para sa mga self-contained task, at inilalarawan ang mga ito bilang pauna.

Kaya ang “local” sa page na iyon ay nangangahulugang isang hakbang ng isang feature. Nasa cloud ang transcription; nasa cloud ang agent; local ang polish bilang default na may cloud fallback.

Paano namin ito sinisipi

Gumagamit ang home page ng dalawang numero mula rito: 488 ms mula sa 876 ms, at ang pangungusap na ang Cue ay “a voice-activated AI agent that lives on the user's desktop.” Parehong nasa page sa mga salitang iyon. Ipinapakita rin sa home page ang isang 45-segundong bahagi ng isang talk ng Gemma team kung saan sinabi ng speaker na tumaas nang 30 porsiyento ang engagement; sinasabi ng nakasulat na case study na paggamit ng feature. Inililimbag namin ang nakasulat na numero at itinatala ang pagkakaiba sa tabi ng bahagi.

Ano ang hindi nito sinusuportahan

  • Hindi ito isang review ng produkto at walang ginagawang pahayag tungkol sa katumpakan ng transcription o tagumpay ng task ng agent.
  • Ang 227-sample benchmark na inilalarawan nito ay pribado sa Cue at hindi nailathala. Ang aming pampublikong dataset, ang Voice Agent Benchmark Landscape, ay ibang bagay: isang mapa ng mga pampublikong benchmark ng ibang tao, na walang mga score.
  • Ang mga numero nito ay may petsang Mayo 2026. Ang isang bersiyon ng Cue na inilabas pagkatapos ng petsang iyon ay hindi inilalarawan ng page.

Itinatala ng page ng mga numero kung paano ginagamit ang numero ng latency sa home page, at inililista ng page ng patunay ang case study kasama ng lahat ng iba pang nailathala tungkol sa aming mga produkto.

Lahat ng post