Documentació · Proves

Voice Agent Benchmark Landscape: registre i citació

Què és i què no és el conjunt de dades, on es publica, les seves versions, llicència i DOI, i com citar-lo. Mantingut per Sophon LLC.

Publicat el · Actualitzat el

El Panorama de benchmarks d’agents de veu és un conjunt de dades que publiquem: un mapa estructurat de benchmarks públics per a agents de veu, assistents de veu, ús d’eines amb veu, accions a l’ordinador, reconeixement de la parla i comprensió de reunions. Aquesta pàgina n’és el registre de publicació.

Què és

  • 13 benchmarks, un per fila, en un fitxer llegible per màquina (data/benchmarks.jsonl) amb un contracte de camps documentat (data/schema.json).
  • Cada fila registra l’enfocament principal del benchmark; si cobreix l’entrada de veu, la sortida de veu, la interacció per torns, l’ús d’eines, la consecució d’objectius, l’acció a l’ordinador o al navegador, el material de reunions o de format llarg i el funcionament en temps real; si les dades són públiques; les llicències del codi i de les dades, registrades per separat; les adreces del repositori, de la fitxa del conjunt de dades i de l’article; la data de l’última verificació; i les notes de prova.
  • Els valors són sí, no, parcial o poc clar. Parcial significa que la capacitat apareix en una part de la suite o s’avalua indirectament; no descriu la qualitat.
  • Cada fila té almenys una font de primera mà, llistada a l’auditoria de fonts. Els fets de la versió actual es van verificar l’1 de setembre de 2026 a partir dels repositoris públics, les fitxes de conjunts de dades i els articles dels mantenidors.

Què no és

  • No és una classificació. No conté puntuacions ni classifica res. La inclusió no implica cap recomanació. El motiu pel qual es va construir així es troba a Com es va construir el panorama de benchmarks d’agents de veu.
  • No és un marc d’avaluació. No hi ha res per executar contra un model; el repositori inclou les dades, el seu esquema, un validador i una eina de consulta.
  • No és el benchmark de Cue. El benchmark de producció privat de 227 mostres descrit a l’estudi de cas de Google DeepMind no en forma part.

On es publica

OnAdreçaFunció
GitHubSophon-LLC/voice-agent-benchmark-landscapeFont de registre: dades, esquema, auditoria de fonts, regles de contribució, proves
Zenododoi.org/10.5281/zenodo.22227265Publicacions arxivades amb DOI; el DOI conceptual sempre resol a la darrera versió.
Hugging Facechatjesus/voice-agent-benchmark-landscapeRèplica del conjunt de dades

Versions

VersióDataRegistresLlicènciaDOI de la versió
v1.0.21 de setembre de 202613MIT10.5281/zenodo.22227266

El registre de Zenodo per a la v1.0.2 inclou el SHA-256 del conjunt de dades (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4) per a poder comprovar una còpia descarregada amb l’arxivada.

Com citar-ho

El fitxer CITATION.cff del repositori anomena Sophon LLC com a autor. Citi el DOI de la versió quan la reproductibilitat exacta sigui important i el DOI del concepte per al projecte en evolució:

Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266

Correccions

Una correcció ha d’anomenar la fila, el camp, el valor proposat i una font de primera mà, seguint el CONTRIBUTING.md del repositori. Els canvis s’envien com una nova versió amb un nou DOI.

Alguna cosa incorrecta en aquesta pàgina? feedback@sophoninc.com