Blog

Comment le paysage des benchmarks d’agents vocaux a été construit, et pourquoi ce n’est pas un classement

Treize benchmarks publics, une ligne chacun, avec la couverture des capacités et les licences provenant de sources primaires. Ce que l’ensemble de données répond et ce qu’il refuse de répondre.

Publié le

« Voice agent evaluation » recouvre plusieurs problèmes différents qu’il est facile de confondre. Un benchmark peut tester la reconnaissance vocale sans tester l’accomplissement de tâches, ou tester les appels d’outils sans interaction vocale en direct. Le Voice Agent Benchmark Landscape existe pour rendre ces frontières explicites. Cet article explique comment il a été construit.

Une ligne par benchmark, une question par champ

L’ensemble de données contient 13 lignes dans sa version du 1er septembre 2026. Pour chaque benchmark, il enregistre l’objectif principal et, dans des champs distincts, si le benchmark couvre l’entrée vocale, la sortie vocale, l’interaction à plusieurs tours, l’utilisation d’outils, l’accomplissement d’objectifs, l’action sur l’ordinateur ou le navigateur, les réunions ou les documents longs, et le fonctionnement en temps réel. Il enregistre également si les données sont publiques, la licence du code et la licence des données séparément, les adresses du dépôt, de la fiche de l’ensemble de données et de l’article, la date de dernière vérification et les notes de preuve.

Chaque valeur de capacité est l’un de ces quatre mots : yes, no, partial ou unclear. « Partial » signifie que la capacité apparaît dans une partie d’une suite ou est évaluée indirectement ; cela n’indique rien sur la qualité. « No » signifie que la capacité est en dehors du périmètre publié ou absente des documents publics, et non que le projet ne pourrait jamais la prendre en charge. « Unclear » est utilisé lorsque les documents publics étaient insuffisants pour classer, et le reste jusqu’à ce qu’une source directe tranche.

Les sources sont directes et les licences sont enregistrées deux fois

Chaque ligne cite le dépôt, la fiche de jeu de données ou la publication des mainteneurs eux-mêmes ; rien n’est classé à partir d’une analyse secondaire. L’audit des sources dans le dépôt liste, pour chaque ligne, les pages qui étayent les valeurs de capacité et les pages qui indiquent les licences. Les licences du code et des données sont enregistrées séparément, car elles diffèrent plus souvent qu’on ne le suppose : le code et les données d’une entrée sont sous une licence communautaire qui n’est pas une licence open source et qui restreint l’usage commercial ; le code d’une autre est sous licence Apache-2.0 tandis que ses données sont sous licence CC BY-NC 4.0 et à accès restreint. Un lecteur qui décide de réutiliser un benchmark a besoin de ces deux informations.

Pourquoi il n’y a pas de scores

Un classement nécessite une tâche partagée et une métrique partagée. Les treize projets ont été conçus pour treize questions d’évaluation différentes, donc un classement unique comparerait des choses qui n’ont pas été conçues pour être comparées. Le panorama enregistre donc ce que chaque benchmark mesure et rien sur la performance d’un système donné. L’inclusion n’implique pas une approbation, et l’ensemble de données ne contient pas le benchmark de production privé de Cue à 227 échantillons décrit dans l’étude de cas de Google DeepMind.

Ce que la carte montre comme manquant

Présenté ainsi, le panorama public est le plus fourni dans le service client conversationnel, la sélection d’outils par la voix, l’évaluation de contenu d’agent vocal et la reconnaissance vocale. Il est mince à l’intersection de la dictée vocale continue sur ordinateur dans des applications arbitraires, de la transcription de réunions longues avec des notes structurées, de l’action sur l’ordinateur entre applications, de la confirmation et de la réversibilité des effets de bord, et de toute évaluation unique qui relie la qualité de la transcription aux résultats pour l’utilisateur. Le dépôt présente cela comme une lacune dans ce qui existe, et non comme un défaut dans un projet particulier.

Garantir l’honnêteté

  • Le fichier de données a un schéma documenté et un validateur ; une ligne qui enfreint le contrat de champ échoue à la vérification.
  • Chaque lien source est revérifié à intervalles réguliers. Une erreur 404 ou 410 définitive fait échouer l’audit ; les limitations de débit et les erreurs transitoires sont signalées séparément afin de ne pas être étiquetées à tort comme des liens brisés.
  • Les versions sont archivées sur Zenodo avec un DOI par version, et l’enregistrement contient le SHA-256 de l’ensemble de données, de sorte qu’une citation pointe vers un fichier exact.
  • Les corrections nomment la ligne, le champ, la valeur proposée et une source directe, et sont publiées comme une nouvelle version.

Le dépôt se trouve à github.com/Sophon-LLC/voice-agent-benchmark-landscape ; le format de citation et la liste des versions sont sur la page de l’enregistrement.

Tous les billets