«Voice agent evaluation» abrangue varios problemas diferentes que son doados de confundir. Un benchmark pode probar o recoñecemento da fala sen probar a finalización de tarefas, ou probar as chamadas a ferramentas sen unha interacción falada en directo. O Voice Agent Benchmark Landscape existe para facer explícitas esas fronteiras. Esta publicación trata sobre como se creou.
Unha fila por benchmark, unha pregunta por campo
O conxunto de datos ten 13 filas na versión do 1 de setembro de 2026. Para cada benchmark rexistra o foco principal e, como campos separados, se o benchmark abrangue a entrada falada, a saída falada, a interacción de varias quendas, o uso de ferramentas, a consecución de obxectivos, a acción no ordenador ou no navegador, o material de reunións ou de formato longo e o funcionamento en tempo real. Tamén rexistra se os datos son públicos, a licenza do código e a licenza dos datos por separado, os enderezos do repositorio, da ficha do conxunto de datos e do artigo, a data da última verificación e as notas de proba.
Cada valor de capacidade é unha de catro palabras: «yes», «no», «partial» ou «unclear». «Partial» significa que a capacidade aparece nunha parte dun conxunto ou se avalía indirectamente; non di nada sobre a calidade. «No» significa que a capacidade está fóra do alcance publicado ou ausente dos materiais públicos, non que o proxecto nunca poida soportala. «Unclear» úsase cando o material público foi insuficiente para clasificar, e mantense ata que unha fonte de primeira man o aclare.
As fontes son primarias e as licenzas rexístranse dúas veces
Cada fila cita o repositorio, a ficha do conxunto de datos ou o artigo dos propios mantedores; nada se clasifica a partir dunha recensión secundaria. A auditoría de fontes no repositorio enumera, por fila, as páxinas que fundamentaron os valores de capacidade e as páxinas que indican as licenzas. As licenzas do código e dos datos rexístranse por separado porque difiren con máis frecuencia do que se supón: o código e os datos dunha entrada están baixo unha licenza comunitaria que non é unha licenza de código aberto e restrinxe o uso comercial; o código doutra é Apache-2.0 mentres que os seus datos son CC BY-NC 4,0 e de acceso restrinxido. Un lector que decida se reutilizar un benchmark necesita ambos os datos.
Por que non hai puntuacións
Unha táboa de clasificación necesita unha tarefa e unha métrica compartidas. Os trece proxectos foron deseñados para trece cuestións de avaliación diferentes, polo que unha única clasificación compararía cousas que non foron creadas para ser comparadas. Polo tanto, o panorama rexistra o que mide cada benchmark e nada sobre como se comporta ningún sistema nel. A inclusión non implica aprobación, e o conxunto de datos non contén o benchmark de produción privado de 227 mostras de Cue descrito no estudo de caso de Google DeepMind.
O que o mapa mostra que falta
Presentado deste xeito, o panorama público é máis forte en atención ao cliente conversacional, selección de ferramentas por voz, avaliación de contidos de axentes de voz e recoñecemento da fala. É escaso na intersección da dixitación continua por voz no escritorio en aplicacións arbitrarias, a transcrición de reunións longas con notas estruturadas, a acción informática entre aplicacións, a confirmación e reversibilidade de efectos secundarios, e calquera avaliación única que conecte a calidade da transcrición cos resultados do usuario. O repositorio afirma isto como unha lagoa no que existe, non como un defecto en ningún proxecto.
Manter a honestidade
- O ficheiro de datos ten un esquema documentado e un validador; unha fila que incumpra o contrato de campo non pasa a comprobación.
- Todas as ligazóns de fontes son revisadas periodicamente. Un 404 ou 410 definitivo non pasa a auditoría; os límites de taxa e os erros transitorios infórmanse por separado para que non se etiqueten erroneamente como ligazóns rotas.
- As versións arquívanse en Zenodo cun DOI por versión, e o rexistro leva o SHA-256 do conxunto de datos, polo que unha cita apunta a un ficheiro exacto.
- As correccións indican a fila, o campo, o valor proposto e unha fonte de primeira man, e distribúense como unha nova versión.
O repositorio está en github.com/Sophon-LLC/voice-agent-benchmark-landscape; o formato de cita e a lista de versións están na páxina do rexistro.