Das Diktat in Cue hat einen Feinschliff-Schritt: Das rohe Transkript mit seinen Füllwörtern und fehlender Zeichensetzung wird in einen Text umgewandelt, der sich so liest, wie der Sprecher es gemeint hat. Wo dieser Schritt ausgeführt wird, wurde durch eine Messung entschieden, und die Messung ist öffentlich. Dieser Beitrag folgt der Fallstudie von Google DeepMind, mit Zahlen auf dem Stand von Mai 2026, und fügt nichts hinzu, was die Seite nicht angibt.
Das ursprüngliche Design
Der Schritt wurde für die Nutzung eines Cloud-Modells entwickelt, mit einem lokalen Modell als Ausweichlösung, unter der Annahme, dass ein größeres Modell den Feinschliff genauer durchführen würde. Das erklärte Ziel des Teams für den Schritt war ein Text, der sich wie der Nutzer liest und nicht wie ein Modell: wiederhergestellte Zeichensetzung, segmentierte Sätze, entfernte Füllwörter, ohne einen Hausstil aufzuzwingen.
Die Messung
Das Team führte einen Benchmark des Schritts mit 227 echten Sprachproben durch, die Englisch, andere Sprachen und gemischtsprachige Eingaben abdeckten. Auf Basis dieses Benchmarks wurde Gemma 4 E4B, das lokal über Ollama auf Apple Silicon läuft, als Modell der ersten Wahl ausgewählt. Die mediane Latenz des Feinschliff-Schritts sank von 876 ms auf 488 ms, was die Seite als innerhalb des Budgets beschreibt, das das Team für einen Schritt festgelegt hatte, der sich schneller anfühlen muss als Tippen.
Die Umkehrung
Nach dem Benchmark wurde die Architektur umgekehrt: Das lokale Modell wurde zum Standard und das Cloud-Modell zur Ausweichlösung. Die Desktop-App prüft beim Start, ob Ollama läuft; ist dies nicht der Fall, wird der Feinschliff-Schritt an ein Cloud-Modell weitergeleitet und das Diktat wird fortgesetzt.
Was sich laut der Seite für Nutzer änderte
- Die Diktatnutzung pro Nutzer stieg bei aktiven Beta-Nutzern in den vier Wochen vor und nach der Umstellung um etwa 30 Prozent; Nutzer, die kurze Nachrichten diktiert hatten, begannen, längere zu diktieren.
- Die marginalen Inferenzkosten des Schritts sanken auf null, und die Seite gibt dies als Grund dafür an, dass das Diktieren in jeder Stufe, einschließlich der kostenlosen, unbegrenzt ist.
Die Grenze der Aussage
Nur der Feinschliff-Schritt wurde verlegt. Die Transkription erfolgt vor dem Feinschliff-Schritt durch einen Cloud-Spracherkennungsdienst, und der Agentenmodus von Cue stützt sich auf ein Cloud-Modell. Die Seite berichtet über frühe Evaluationen des Funktionsaufrufs von Gemma 4 für in sich geschlossene Agentenaufgaben und bezeichnet diese als früh. Unsere Startseite gibt daher an, dass der Feinschliff auf dem Rechner des Nutzers läuft, und sagt nichts darüber aus, dass der Agent lokal läuft; die Seite Plattformen hält dieselbe Abgrenzung fest.