«“Voice agent evaluation”» cobreix diversos problemes diferents que són fàcils de confondre. Un benchmark pot avaluar el reconeixement de la parla sense avaluar la finalització de tasques, o avaluar les crides a eines sense una interacció parlada en directe. El Voice Agent Benchmark Landscape existeix per fer explícites aquestes fronteres. Aquest article tracta sobre com es va construir.
Una fila per benchmark, una pregunta per camp
El conjunt de dades té 13 files en la versió de l'1 de setembre de 2026. Per a cada benchmark, registra l'enfocament principal i, en camps separats, si el benchmark cobreix l'entrada de veu, la sortida de veu, la interacció en diversos torns, l'ús d'eines, la realització d'objectius, l'acció a l'ordinador o al navegador, el material de reunions o de format llarg i el funcionament en temps real. També registra si les dades són públiques, la llicència del codi i la llicència de les dades per separat, les adreces del repositori, de la fitxa del conjunt de dades i de l'article, la data de l'última verificació i les notes de proves.
Cada valor de capacitat és una de quatre paraules: yes, no, partial o unclear. «Partial» significa que la capacitat apareix en una part d’una suite o s’avalua indirectament; no diu res sobre la qualitat. «No» significa que la capacitat queda fora de l’abast publicat o que no és present als materials públics, no que el projecte no la pugui admetre mai. «Unclear» s’utilitza quan el material públic era insuficient per classificar-la, i es manté fins que una font de primera mà ho aclareixi.
Les fonts són originals i les llicències es registren dues vegades
Cada fila cita el repositori, la fitxa del conjunt de dades o l’article dels mateixos mantenidors; no es classifica res a partir d’una ressenya secundària. L’auditoria de fonts del repositori enumera, per a cada fila, les pàgines que avalen els valors de capacitat i les pàgines que indiquen les llicències. Les llicències del codi i de les dades es registren per separat perquè difereixen més sovint del que la gent suposa: el codi i les dades d’una entrada estan sota una llicència comunitària que no és una llicència de codi obert i que en restringeix l’ús comercial; el codi d’una altra és Apache-2.0, mentre que les seves dades són CC BY-NC 4,0 i d’accés restringit. Un lector que decideixi si reutilitza un benchmark necessita ambdues dades.
Per què no hi ha puntuacions
Un «leaderboard» necessita una tasca compartida i una mètrica compartida. Els tretze projectes es van dissenyar per a tretze preguntes d’avaluació diferents, de manera que una única classificació compararia coses que no es van crear per ser comparades. Per tant, el panorama registra què mesura cada benchmark i res sobre com s’hi comporta cap sistema. La inclusió no implica cap aprovació, i el conjunt de dades no conté el benchmark de producció privat de 227 mostres de Cue descrit a l’estudi de cas de Google DeepMind.
Què mostra el mapa que falta
Presentat d’aquesta manera, el panorama públic és més sòlid en l’atenció al client conversacional, la selecció d’eines per veu, l’avaluació de continguts d’agents de veu i el reconeixement de la parla. És escàs en la intersecció de la mecanografia contínua per veu a l’escriptori en aplicacions arbitràries, la transcripció de reunions llargues amb notes estructurades, l’acció informàtica entre aplicacions, la confirmació i reversibilitat dels efectes secundaris, i qualsevol avaluació única que connecti la qualitat de la transcripció amb els resultats de l’usuari. El repositori ho indica com una mancança en el que existeix, no com un defecte de cap projecte.
Mantenir l’honestedat
- El fitxer de dades té un esquema documentat i un validador; una fila que incompleixi el contracte de camps no passa la comprovació.
- Cada enllaç de font es torna a comprovar periòdicament. Un 404 o 410 definitiu fa que l’auditoria falli; els límits de taxa i els errors transitoris s’informen per separat perquè no s’etiquetin erròniament com a enllaços trencats.
- Les versions s’arxiven a Zenodo amb un DOI per versió, i el registre conté l’SHA-256 del conjunt de dades, de manera que una citació apunta a un fitxer exacte.
- Les correccions anomenen la fila, el camp, el valor proposat i una font de primera mà, i es publiquen com una nova versió.
El repositori es troba a github.com/Sophon-LLC/voice-agent-benchmark-landscape; el format de citació i la llista de versions són a la pàgina del registre.