Studium przypadku Google DeepMind dotyczące Cue to jedyny zewnętrzny dowód na temat naszego produktu, dlatego jest cytowane – przez nas i przez innych. Ten wpis przedstawia, co zawiera ta strona, aby można było zweryfikować cytaty. Strona znajduje się pod adresem deepmind.google/models/gemma/gemmaverse/cue-ai; podane na niej liczby są aktualne na maj 2026 roku.
Co zmierzono
- Mediana opóźnienia kroku dopracowania dyktanda w Cue spadła z 876 ms do 488 ms po przeniesieniu tego kroku z modelu w chmurze na model Gemma 4 E4B uruchamiany lokalnie przez Ollama. Strona nazywa to redukcją o 44 procent.
- Pomiaru dokonano na Apple Silicon (seria M) za pośrednictwem Ollama, na benchmarku 227 rzeczywistych próbek głosowych obejmujących język angielski i dane wejściowe w wielu językach.
- Wykorzystanie dyktanda na użytkownika wzrosło o około 30 procent, mierzone wśród aktywnych użytkowników wersji beta w ciągu czterech tygodni przed i po tym, jak model lokalny stał się domyślny.
- Krańcowy koszt inferencji kroku dopracowania spadł do zera, co strona podaje jako powód, dla którego dyktando jest nielimitowane w każdym planie, w tym darmowym.
Co gdzie działa, według strony
- Użytkownik przytrzymuje skrót klawiszowy i mówi. Dźwięk jest transkrybowany na surowy tekst przez usługę zamiany mowy na tekst w chmurze.
- Surowy tekst jest wysyłany do modelu Gemma 4 działającego lokalnie na maszynie użytkownika przez Ollama, z poleceniem systemowym o długości około 400 tokenów, które przywraca interpunkcję, dzieli zdania i usuwa słowa-wypełniacze.
- Jeśli Ollama nie jest uruchomiona, aplikacja desktopowa wykrywa to przy starcie i przekierowuje krok dopracowania do modelu w chmurze.
- Tryb agenta w Cue opiera się na modelu w chmurze. Strona przedstawia wczesne oceny wywoływania funkcji przez Gemma 4 dla zadań autonomicznych i opisuje je jako wczesne.
Słowo „local” na tej stronie oznacza więc jeden krok jednej funkcji. Transkrypcja odbywa się w chmurze, agent działa w chmurze, a dopracowanie jest domyślnie lokalne, z opcją awaryjną w chmurze.
Jak cytujemy studium przypadku
Strona główna korzysta z dwóch liczb z tego studium: 488 ms wobec wcześniejszych 876 ms oraz ze zdania, że Cue to „a voice-activated AI agent that lives on the user's desktop.” Oba są na stronie dokładnie tymi słowami. Strona główna pokazuje też 45-sekundowy fragment wystąpienia zespołu Gemma, w którym prelegent mówi, że zaangażowanie wzrosło o 30 procent; pisemne studium przypadku mówi o korzystaniu z funkcji. Podajemy liczbę z wersji pisemnej i odnotowujemy różnicę obok fragmentu.
Czego studium przypadku nie potwierdza
- Nie jest to recenzja produktu i nie zawiera żadnych twierdzeń na temat dokładności transkrypcji ani skuteczności agenta w wykonywaniu zadań.
- Opisany w nim benchmark na 227 próbkach jest prywatny dla Cue i nie został opublikowany. Nasz publiczny zbiór danych, Voice Agent Benchmark Landscape, to coś innego: mapa publicznych benchmarków innych podmiotów, bez wyników.
- Podane w nim liczby pochodzą z maja 2026 roku. Strona nie opisuje wersji Cue wydanej po tej dacie.
Strona z liczbami dokumentuje, w jaki sposób liczba dotycząca opóźnień jest wykorzystywana na stronie głównej, a strona z dowodami wymienia to studium przypadku obok wszystkich innych opublikowanych materiałów o naszych produktach.