Blogu

Çfarë thotë studimi i rastit i DeepMind për Cue, dhe çfarë nuk thotë

Google DeepMind publikoi një studim rasti për Cue në 2026: çfarë mati, çfarë ekzekutohet ku, si e citojmë ne atë, dhe pohimet që nuk i mbështet.

Publikuar më

Studimi i rastit i Google DeepMind për Cue është e vetmja provë e jashtme për një produkt tonin, kështu që citohet, nga ne dhe nga të tjerët. Ky postim paraqet atë që thotë faqja, në mënyrë që citimet të mund të kontrollohen me të. Faqja gjendet në deepmind.google/models/gemma/gemmaverse/cue-ai; shifrat e saj shënohen si aktuale që nga maji 2026.

Çfarë mati

  • Latenca mediane e hapit të lëmimit të diktimit të Cue ra nga 876 ms në 488 ms pasi hapi kaloi nga një model në cloud në Gemma 4 E4B që ekzekutohet lokalisht përmes Ollama. Faqja e quan atë një reduktim prej 44 për qind.
  • Matja u bë në Apple Silicon (seria M) përmes Ollama, mbi një benchmark prej 227 mostrash zanore reale që mbulojnë hyrjen në anglisht dhe në gjuhë të përziera.
  • Diktimi për përdorues u rrit me rreth 30 për qind, i matur te përdoruesit aktivë të versionit beta në katër javët para dhe pas se modeli lokal u bë parazgjedhje.
  • Kostoja margjinale e inferencës së hapit të lëmimit ra në zero, gjë që faqja e jep si arsyen pse diktimi është i pakufizuar në çdo nivel, përfshirë atë falas.

Çfarë ekzekutohet ku, sipas faqes

  • Përdoruesi mban shtypur një tast të shkurtër dhe flet. Audioja transkriptohet në tekst të papërpunuar nga një shërbim cloud i shndërrimit të të folurit në tekst.
  • Teksti i papërpunuar i dërgohet Gemma 4 që ekzekutohet lokalisht në makinën e përdoruesit përmes Ollama, me një kërkesë sistemi prej rreth 400 tokenash që rikthen shenjat e pikësimit, segmenton fjalitë dhe heq fjalët mbushëse.
  • Nëse Ollama nuk është aktiv, aplikacioni desktop e zbulon këtë në nisje dhe e kalon hapin e lëmimit te një model cloud.
  • Modaliteti i agjentit i Cue mbështetet te një model cloud. Faqja raporton vlerësime të hershme të thirrjes së funksioneve të Gemma 4 për detyra të pavarura dhe i përshkruan ato si të hershme.

Pra, “local” në atë faqe do të thotë një hap i një veçorie. Transkriptimi është në cloud; agjenti është në cloud; lëmi është lokal si parazgjedhje me një alternativë rezervë në cloud.

Si e citojmë atë

Faqja kryesore përdor dy shifra prej tij: 488 ms, rënie nga 876 ms, dhe fjalinë se Cue është “a voice-activated AI agent that lives on the user's desktop.” Të dyja janë në faqe me ato fjalë. Faqja kryesore tregon gjithashtu një segment 45-sekondësh të një fjalimi të ekipit Gemma, në të cilin folësi thotë se angazhimi u rrit me 30 për qind; studimi i rastit i shkruar thotë përdorimi i veçorive. Ne printojmë shifrën e shkruar dhe e shënojmë ndryshimin pranë segmentit.

Çfarë nuk mbështet

  • Nuk është një recension produkti dhe nuk bën asnjë pohim për saktësinë e transkriptimit apo suksesin e detyrave të agjentit.
  • Benchmark-u me 227 mostra që përshkruan është privat për Cue dhe nuk është i publikuar. Baza jonë publike e të dhënave, Voice Agent Benchmark Landscape, është një gjë tjetër: një hartë e benchmark-eve publike të njerëzve të tjerë, pa rezultate.
  • Shifrat e tij janë të datës maj 2026. Një version i Cue i lëshuar pas asaj date nuk përshkruhet nga faqja.

Faqja e shifrave regjistron se si përdoret shifra e latencës në faqen kryesore, dhe faqja e provave liston studimin e rastit krahas gjithçkaje tjetër që është publikuar për produktet tona.

Të gjitha postimet