Blog

Domyślnie lokalnie, chmura jako tryb awaryjny: jak etap dopracowania w Cue trafił na komputer użytkownika

Etap dopracowania dyktowania w Cue zaprojektowano z myślą o chmurze, z lokalnym trybem awaryjnym. Benchmark na 227 próbkach odwrócił tę decyzję. Co studium przypadku mówi o tej decyzji.

Opublikowano

Dyktowanie w Cue ma etap dopracowania: surowa transkrypcja, z jej wypełniaczami i brakującą interpunkcją, jest zamieniana na tekst, który czyta się tak, jak chciał mówca. To, gdzie ten etap jest wykonywany, zostało ustalone na podstawie pomiaru, a pomiar jest publiczny. Ten wpis omawia studium przypadku Google DeepMind, z liczbami aktualnymi na maj 2026, i nie dodaje niczego, czego nie ma na tej stronie.

Pierwotny projekt

Etap ten został zbudowany tak, by korzystać z modelu w chmurze, z modelem lokalnym jako trybem awaryjnym, przy założeniu, że większy model będzie dopracowywał tekst dokładniej. Deklarowanym celem zespołu dla tego etapu był tekst, który brzmi jak użytkownik, a nie jak model: z przywróconą interpunkcją, podzielony na zdania, z usuniętymi wypełniaczami, bez narzucania stylu redakcyjnego.

Pomiar

Zespół przeprowadził benchmark tego etapu na 227 rzeczywistych próbkach głosowych, obejmujących język angielski, inne języki i dane wejściowe w wielu językach. Na podstawie tego benchmarku jako model pierwszego wyboru wybrano Gemma 4 E4B, uruchamiany lokalnie przez Ollama na Apple Silicon. Mediana opóźnienia etapu dopracowania spadła z 876 ms do 488 ms, co strona opisuje jako mieszczące się w budżecie, który zespół ustalił dla etapu, który musi wydawać się szybszy niż pisanie na klawiaturze.

Odwrócenie decyzji

Po benchmarku architektura została odwrócona: model lokalny stał się domyślny, a model w chmurze stał się trybem awaryjnym. Aplikacja desktopowa przy uruchomieniu sprawdza, czy Ollama działa; jeśli nie, etap dopracowania jest kierowany do modelu w chmurze, a dyktowanie jest kontynuowane.

Co zmieniło się dla użytkowników, według strony

  • Liczba dyktowań na użytkownika wzrosła o około 30 procent wśród aktywnych użytkowników bety w ciągu czterech tygodni przed i po zmianie; użytkownicy, którzy dyktowali krótkie wiadomości, zaczęli dyktować dłuższe.
  • Krańcowy koszt inferencji dla tego etapu spadł do zera, a strona podaje to jako powód, dla którego dyktowanie jest nielimitowane w każdym planie, w tym w darmowym.

Zakres twierdzenia

Przeniesiono tylko etap dopracowania. Transkrypcja jest wykonywana przez usługę mowy na tekst w chmurze przed etapem dopracowania, a tryb agenta w Cue opiera się na modelu w chmurze. Strona informuje o wczesnych ocenach wywoływania funkcji przez Gemma 4 dla samodzielnych zadań agenta i nazywa je wczesnymi. Dlatego nasza strona główna informuje, że dopracowanie działa na komputerze użytkownika, i nie mówi nic o lokalnym działaniu agenta; strona platform odnotowuje to samo rozgraniczenie.

Wszystkie wpisy