Die Fallstudie von Google DeepMind zu Cue ist der einzige externe Beleg für eines unserer Produkte, daher wird sie von uns und von anderen zitiert. Dieser Beitrag legt dar, was die Seite aussagt, damit die Zitate damit abgeglichen werden können. Die Seite befindet sich unter deepmind.google/models/gemma/gemmaverse/cue-ai; ihre Zahlen sind als aktuell für Mai 2026 gekennzeichnet.
Was gemessen wurde
- Die mediane Latenz des Feinschliff-Schritts beim Diktieren von Cue fiel von 876 ms auf 488 ms, nachdem der Schritt von einem Cloud-Modell auf Gemma 4 E4B umgestellt wurde, das lokal über Ollama läuft. Die Seite nennt das eine Reduzierung um 44 Prozent.
- Die Messung wurde auf Apple Silicon (M-Serie) über Ollama durchgeführt, über einen Benchmark von 227 echten Sprachproben, die englische und gemischtsprachige Eingaben abdeckten.
- Das Diktieren pro Nutzer stieg um etwa 30 Prozent, gemessen über aktive Beta-Nutzer in den vier Wochen vor und nach der Umstellung auf das lokale Modell als Standard.
- Die marginalen Inferenzkosten des Feinschliff-Schritts fielen auf null, was die Seite als Grund dafür angibt, dass das Diktieren in jeder Stufe, einschließlich der kostenlosen, unbegrenzt ist.
Was laut der Seite wo ausgeführt wird
- Der Nutzer hält eine Tastenkombination gedrückt und spricht. Audio wird von einem Cloud-Dienst für Spracherkennung in Rohtext transkribiert.
- Der Rohtext wird an Gemma 4 gesendet, das über Ollama lokal auf dem Rechner des Nutzers läuft, mit einem System-Prompt von etwa 400 Token, der Satzzeichen wiederherstellt, Sätze segmentiert und Füllwörter entfernt.
- Wenn Ollama nicht läuft, erkennt die Desktop-App dies beim Start und leitet den Feinschliff-Schritt an ein Cloud-Modell weiter.
- Der Agentenmodus von Cue stützt sich auf ein Cloud-Modell. Die Seite berichtet über frühe Evaluationen des Function-Calling von Gemma 4 für abgeschlossene Aufgaben und beschreibt sie als früh.
Das heißt: „local“ bezieht sich auf dieser Seite auf einen Schritt einer Funktion. Die Transkription läuft in der Cloud, der Agent läuft in der Cloud, und der Feinschliff läuft standardmäßig lokal mit einem Rückfall auf die Cloud.
Wie wir daraus zitieren
Die Startseite verwendet zwei Zahlen daraus: 488 ms statt 876 ms und den Satz, dass Cue „a voice-activated AI agent that lives on the user's desktop.“ ist. Beide stehen mit diesen Worten auf der Seite. Die Startseite zeigt auch einen 45-sekündigen Ausschnitt aus einem Vortrag des Gemma-Teams, in dem der Sprecher sagt, das Engagement sei um 30 Prozent gestiegen; die schriftliche Fallstudie nennt die Feature-Nutzung. Wir drucken die schriftliche Zahl ab und vermerken den Unterschied neben dem Ausschnitt.
Was sie nicht unterstützt
- Sie ist keine Produktrezension und gibt keine Genauigkeit der Transkription oder den Erfolg von Agentenaufgaben an.
- Der darin beschriebene Benchmark mit 227 Stichproben ist privat für Cue und wird nicht veröffentlicht. Unser öffentlicher Datensatz, die Voice Agent Benchmark Landscape, ist etwas anderes: eine Übersicht über die öffentlichen Benchmarks anderer, ohne Punktzahlen.
- Ihre Zahlen sind vom Mai 2026. Eine nach diesem Datum veröffentlichte Version von Cue wird von der Seite nicht beschrieben.
Die Seite mit den Zahlen dokumentiert, wie die Latenzzahl auf der Startseite verwendet wird, und die Seite mit den Belegen listet die Fallstudie neben allem anderen auf, was über unsere Produkte veröffentlicht wurde.