Blogi

Mitä DeepMindin tapaustutkimus sanoo Cuesta ja mitä se ei sano

Google DeepMind julkaisi vuonna 2026 tapaustutkimuksen Cuesta: mitä se mittasi, mikä toimii missäkin, miten lainaamme sitä ja väitteet, joita se ei tue.

Julkaistu

Google DeepMindin tapaustutkimus Cuesta on ainoa ulkopuolinen näyttö tuotteestamme, joten sitä lainataan, sekä meidän että muiden toimesta. Tämä kirjoitus esittää, mitä sivulla sanotaan, jotta lainaukset voidaan tarkistaa sitä vasten. Sivu on osoitteessa deepmind.google/models/gemma/gemmaverse/cue-ai; sen lukujen ilmoitetaan olevan ajantasaisia toukokuussa 2026.

Mitä se mittasi

  • Cuen sanelun viimeistelyvaiheen mediaanilantenssi laski 876 ms:stä 488 ms:iin sen jälkeen, kun vaihe siirtyi pilvimallista paikallisesti Ollaman kautta ajettavaan Gemma 4 E4B -malliin. Sivulla tätä kutsutaan 44 prosentin vähennykseksi.
  • Mittaus tehtiin Apple Siliconilla (M-sarja) Ollaman kautta, käyttäen 227 todellisen ääninäytteen benchmarkia, joka kattoi englannin- ja sekakielisen syötteen.
  • Sanelu käyttäjää kohden nousi noin 30 prosenttia, mitattuna aktiivisilta beetakäyttäjiltä neljän viikon aikana ennen ja jälkeen paikallisen mallin tuloa oletukseksi.
  • Viimeistelyvaiheen marginaalinen päättelykustannus putosi nollaan, minkä sivu ilmoittaa syyksi sille, että sanelu on rajoittamaton kaikilla tasoilla, myös ilmaisella.

Mikä toimii missäkin, sivun mukaan

  • Käyttäjä pitää pikanäppäintä pohjassa ja puhuu. Ääni litteroidaan raakatekstiksi pilvipohjaisella puheentunnistuspalvelulla.
  • Raakateksti lähetetään käyttäjän koneella paikallisesti Ollaman kautta ajettavalle Gemma 4:lle, noin 400 tokenin järjestelmäkehotteella, joka palauttaa välimerkit, jakaa lauseisiin ja poistaa täytesanat.
  • Jos Ollama ei ole käynnissä, työpöytäsovellus havaitsee sen käynnistyessään ja ohjaa viimeistelyvaiheen pilvimallille.
  • Cuen agenttitila perustuu pilvimalliin. Sivulla kerrotaan Gemma 4:n funktiokutsujen varhaisista arvioinneista itsenäisissä tehtävissä ja kuvaillaan niitä alustaviksi.

Sivulla ”local” tarkoittaa siis yhden ominaisuuden yhtä vaihetta. Litterointi on pilvipalvelu, agentti on pilvipalvelu ja viimeistely on oletuksena paikallinen pilvivarmennuksella.

Miten lainaamme sitä

Etusivulla käytetään siitä kahta lukua: 488 ms, kun aiemmin oli 876 ms, sekä lausetta, jonka mukaan Cue on ”a voice-activated AI agent that lives on the user's desktop.” Molemmat ovat sivulla tässä muodossa. Etusivulla näytetään myös 45 sekunnin pätkä Gemma-tiimin esityksestä, jossa puhuja sanoo sitoutumisen nousseen 30 prosenttia; kirjallisessa tapaustutkimuksessa puhutaan ominaisuuksien käytöstä. Käytämme kirjallista lukua ja mainitsemme eron pätkän vieressä.

Mitä se ei tue

  • Se ei ole tuotearvostelu eikä esitä väitteitä litteroinnin tarkkuudesta tai agentin tehtävien onnistumisesta.
  • Sen kuvailema 227 näytteen benchmark on Cuen yksityinen, eikä sitä ole julkaistu. Julkinen data-aineistomme, Voice Agent Benchmark Landscape, on eri asia: se on kartta muiden julkisista benchmarkeista, ilman pistemääriä.
  • Sen luvut ovat toukokuulta 2026. Sivu ei kuvaile Cuen versiota, joka on julkaistu tuon päivämäärän jälkeen.

Luvut-sivulla on kirjattu, miten viivelukua käytetään etusivulla, ja näyttö-sivulla on lueteltu tapaustutkimus kaiken muun tuotteistamme julkaistun aineiston ohella.

Kaikki kirjoitukset