Documentation · Preuves

Voice Agent Benchmark Landscape : enregistrement et citation

Ce que l’ensemble de données est et n’est pas, où il est publié, ses versions, sa licence et ses DOI, et comment le citer. Maintenu par Sophon LLC.

Publié le · Mis à jour le

Le Voice Agent Benchmark Landscape est un jeu de données que nous publions : une carte structurée des benchmarks publics pour les agents vocaux, les assistants vocaux, l’utilisation d’outils par la parole, l’action sur ordinateur, la reconnaissance vocale et la compréhension de réunions. Cette page constitue son enregistrement de publication.

Ce que c’est

  • 13 benchmarks, une ligne chacun, dans un fichier lisible par machine (data/benchmarks.jsonl) avec un contrat de champ documenté (data/schema.json).
  • Chaque ligne enregistre l’objectif principal du benchmark ; s’il couvre l’entrée vocale, la sortie vocale, l’interaction à plusieurs tours, l’utilisation d’outils, l’accomplissement d’objectifs, l’action sur ordinateur ou navigateur, les réunions ou les contenus longs, et le fonctionnement en temps réel ; si les données sont publiques ; les licences du code et des données, enregistrées séparément ; les adresses du dépôt, de la fiche du jeu de données et de l’article ; la date de dernière vérification ; et les notes de preuve.
  • Les valeurs sont oui, non, partiel ou incertain. Partiel signifie que la capacité apparaît dans une partie de la suite ou est évaluée indirectement ; cela ne décrit pas la qualité.
  • Chaque ligne a au moins une source de première main, listée dans l’audit des sources. Les faits de la version actuelle ont été vérifiés le 1er septembre 2026 à partir des dépôts publics, des fiches de jeux de données et des articles des mainteneurs.

Ce que ce n’est pas

  • Pas un classement. Il ne contient aucun score et ne classe rien. Son inclusion n’implique pas une approbation. La raison pour laquelle il a été conçu ainsi est dans Comment le paysage des benchmarks d’agents vocaux a été construit.
  • Pas un cadre d’évaluation. Il n’y a rien à exécuter sur un modèle ; le dépôt fournit les données, leur schéma, un validateur et un outil de requête.
  • Pas le benchmark de Cue. Le benchmark de production privé de 227 échantillons décrit dans l’étude de cas de Google DeepMind n’en fait pas partie.

Où il est publié

OùAdresseRôle
GitHubSophon-LLC/voice-agent-benchmark-landscapeSource de référence : données, schéma, audit des sources, règles de contribution, tests
Zenododoi.org/10.5281/zenodo.22227265Versions archivées avec des DOI ; le DOI conceptuel renvoie toujours vers la dernière version.
Hugging Facechatjesus/voice-agent-benchmark-landscapeMiroir de l’ensemble de données.

Versions

VersionDateEnregistrementsLicenceDOI de la version
v1.0.21er septembre 202613MIT10.5281/zenodo.22227266

L’enregistrement Zenodo pour la v1.0.2 contient le SHA-256 de l’ensemble de données (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4) afin qu’une copie téléchargée puisse être vérifiée par rapport à la version archivée.

Comment citer

Le fichier CITATION.cff du dépôt nomme Sophon LLC comme auteur. Citez le DOI de la version lorsque la reproductibilité exacte est importante et le DOI conceptuel pour le projet en évolution :

Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266

Corrections

Une correction nomme la ligne, le champ, la valeur proposée et une source primaire, conformément au fichier CONTRIBUTING.md du dépôt. Les modifications sont publiées sous la forme d’une nouvelle version avec un nouveau DOI.

Un problème sur cette page ? feedback@sophoninc.com