„Voice agent evaluation“ umfasst mehrere verschiedene Probleme, die man leicht verwechseln kann. Ein Benchmark kann Spracherkennung testen, ohne die Erledigung von Aufgaben zu testen, oder Tool-Aufrufe ohne eine gesprochene Live-Interaktion. Das Voice Agent Benchmark Landscape existiert, um diese Grenzen explizit zu machen. Dieser Beitrag handelt davon, wie es erstellt wurde.
Eine Zeile pro Benchmark, eine Frage pro Feld
Der Datensatz in der Version vom 1. September 2026 hat 13 Zeilen. Für jeden Benchmark erfasst er den primären Fokus und, in separaten Feldern, ob der Benchmark gesprochene Eingabe, gesprochene Ausgabe, mehrstufige Interaktion, Werkzeugnutzung, Zielerreichung, Computer- oder Browseraktionen, Besprechungen oder Langform-Material und Echtzeitbetrieb abdeckt. Er erfasst auch, ob die Daten öffentlich sind, die Code- und die Datenlizenz separat, die Adressen des Repositorys, der Dataset Card und des Papers, das Datum der letzten Überprüfung und Belege.
Jeder Fähigkeitswert ist eines von vier Wörtern: yes, no, partial oder unclear. „Partial“ bedeutet, dass die Fähigkeit in einem Teil einer Suite vorkommt oder indirekt evaluiert wird; es sagt nichts über die Qualität aus. „No“ bedeutet, dass die Fähigkeit außerhalb des veröffentlichten Umfangs liegt oder in den öffentlichen Materialien fehlt, nicht, dass das Projekt sie niemals unterstützen könnte. „Unclear“ wird verwendet, wenn das öffentliche Material für eine Klassifizierung nicht ausreichte, und bleibt bestehen, bis eine Erstanbieterquelle dies klärt.
Quellen sind von Erstanbietern, und Lizenzen werden doppelt erfasst
Jede Zeile zitiert das Repository, die Dataset-Karte oder das Paper der jeweiligen Maintainer. Nichts wird aus einer sekundären Beschreibung klassifiziert. Das Quellen-Audit im Repository listet für jede Zeile die Seiten auf, die die Fähigkeitswerte belegen, und die Seiten, die die Lizenzen angeben. Code- und Datenlizenzen werden separat erfasst, weil sie häufiger voneinander abweichen, als man annimmt: Bei einem Eintrag stehen Code und Daten unter einer Community-Lizenz, die keine Open-Source-Lizenz ist und die kommerzielle Nutzung einschränkt; bei einem anderen ist der Code Apache-2.0, während die Daten unter CC BY-NC 4.0 stehen und zugangsbeschränkt sind. Ein Leser, der entscheidet, ob er einen Benchmark wiederverwenden soll, benötigt beide Informationen.
Warum es keine Punktzahlen gibt
Eine Rangliste benötigt eine gemeinsame Aufgabe und eine gemeinsame Metrik. Die dreizehn Projekte wurden für dreizehn verschiedene Evaluationsfragen konzipiert, sodass eine einzige Rangliste Dinge vergleichen würde, die nicht für einen Vergleich gebaut wurden. Die Landschaft erfasst daher, was jeder Benchmark misst, und nichts darüber, wie ein System darin abschneidet. Die Aufnahme impliziert keine Befürwortung, und der Datensatz enthält nicht den privaten 227-Stichproben-Produktionsbenchmark von Cue, der in der Fallstudie von Google DeepMind beschrieben wird.
Was die Karte als fehlend zeigt
So dargestellt ist die öffentliche Landschaft am stärksten im konversationellen Kundenservice, bei der gesprochenen Werkzeugauswahl, der Evaluation von Sprachagenten-Inhalten und der Spracherkennung. Sie ist dünn an der Schnittstelle von kontinuierlicher Desktop-Spracheingabe in beliebigen Anwendungen, der Transkription von Langform-Besprechungen mit strukturierten Notizen, anwendungsübergreifenden Computeraktionen, der Bestätigung und Umkehrbarkeit von Nebeneffekten und jeder einzelnen Evaluation, die die Transkriptionsqualität mit den Ergebnissen für den Nutzer verbindet. Das Repository gibt dies als eine Lücke im Bestehenden an, nicht als einen Mangel in einem Projekt.
Wie die Ehrlichkeit gewahrt wird
- Die Datendatei hat ein dokumentiertes Schema und einen Validator; eine Zeile, die den Feldvertrag bricht, besteht die Prüfung nicht.
- Jeder Quelllink wird planmäßig erneut überprüft. Ein definitiver 404 oder 410 führt zum Scheitern der Prüfung; Ratenbegrenzungen und vorübergehende Fehler werden separat gemeldet, damit sie nicht fälschlicherweise als defekte Links bezeichnet werden.
- Versionen werden auf Zenodo mit einem DOI pro Version archiviert, und der Eintrag enthält den SHA-256 des Datensatzes, sodass ein Zitat auf eine exakte Datei verweist.
- Korrekturen benennen die Zeile, das Feld, den vorgeschlagenen Wert und eine Erstanbieterquelle und werden als neue Version veröffentlicht.
Das Repository befindet sich unter github.com/Sophon-LLC/voice-agent-benchmark-landscape; das Zitierformat und die Versionsliste sind auf der Eintragsseite.