Diktat u aplikaciji Cue ima korak dotjerivanja: sirovi transkript, s poštapalicama i bez interpunkcije, pretvara se u tekst koji se čita onako kako je govornik zamislio. Gdje se taj korak izvršava odlučeno je mjerenjem, a to je mjerenje javno. Ova objava prati studiju slučaja tvrtke Google DeepMind, s podacima ažuriranima u svibnju 2026., i ne dodaje ništa što na toj stranici ne piše.
Izvorni dizajn
Korak je osmišljen tako da koristi model u oblaku, s lokalnim modelom kao rezervnom opcijom, uz pretpostavku da će veći model preciznije dotjerati tekst. Navedeni cilj tima za taj korak bio je tekst koji zvuči kao korisnik, a ne kao model: s vraćenom interpunkcijom, segmentiranim rečenicama, uklonjenim poštapalicama, bez nametanja kućnog stila.
Mjerenje
Tim je proveo benchmark koraka na 227 stvarnih glasovnih uzoraka koji su pokrivali engleski, druge jezike i mješoviti jezični unos. Na temelju tog benchmarka, Gemma 4 E4B, koji se izvršava lokalno putem aplikacije Ollama na Apple Siliconu, odabran je kao model prvog izbora. Medijan latencije koraka dotjerivanja pao je s 876 ms na 488 ms, što stranica opisuje kao unutar proračuna koji je tim postavio za korak koji se mora činiti bržim od tipkanja.
Preokret
Nakon benchmarka, arhitektura je preokrenuta: lokalni model postao je zadani, a model u oblaku rezervna opcija. Desktop aplikacija pri pokretanju provjerava je li Ollama pokrenut; ako nije, korak dotjerivanja preusmjerava se na model u oblaku i diktiranje se nastavlja.
Što se promijenilo za korisnike, prema stranici
- Diktiranje po korisniku poraslo je za oko 30 posto među aktivnim beta korisnicima u četiri tjedna prije i poslije promjene; korisnici koji su diktirali kratke poruke počeli su diktirati duže.
- Granični trošak inferencije za taj korak pao je na nulu, a stranica navodi to kao razlog zašto je diktiranje neograničeno na svim razinama usluge, uključujući besplatnu.
Granica tvrdnje
Samo je korak dotjerivanja premješten. Transkripciju obavlja usluga pretvaranja govora u tekst u oblaku prije koraka dotjerivanja, a Cueov način rada agenta oslanja se na model u oblaku. Stranica izvještava o ranim evaluacijama pozivanja funkcija modela Gemma 4 za samostalne zadatke agenta i naziva ih ranima. Naša početna stranica stoga navodi da se dotjerivanje izvršava na korisnikovu računalu i ne govori ništa o lokalnom izvršavanju agenta; stranica Platforme bilježi istu granicu.