语音智能体基准图景是我们发布的一个数据集:一个结构化的地图,涵盖了语音智能体、语音助手、语音驱动的工具使用、计算机操作、语音识别和会议理解的公开基准。本页面是其发布记录。
它是什么
- 13 个基准,每个一行,位于一个机器可读文件(data/benchmarks.jsonl)中,并附有已文档化的字段约定(data/schema.json)。
- 每一行记录了基准的主要关注点;是否涵盖语音输入、语音输出、多轮交互、工具使用、目标完成、计算机或浏览器操作、会议或长篇材料以及实时操作;数据是否公开;代码和数据的许可证(分开记录);代码仓库、数据集卡片和论文的地址;上次验证的日期;以及证据说明。
- 值为“是”“否”“部分”或“不明确”。“部分”意味着该能力出现在套件的一部分中或被间接评估;它不描述质量。
- 每一行都至少有一个第一方来源,列于来源审计中。当前版本中的事实于 2026 年 9 月 1 日根据维护者的公开代码仓库、数据集卡片和论文进行了验证。
它不是什么
- 不是排行榜。它不包含任何分数,也不对任何内容进行排名。收录不代表认可。其构建方式的原因见语音智能体基准概览的构建方式。
- 不是评估框架。没有任何东西可以针对模型运行;该代码仓库提供数据、其架构、一个验证器和一个查询工具。
- 不是 Cue 的基准。Google DeepMind 案例研究中描述的包含 227 个样本的私有生产基准不属于它的一部分。
发布位置
| 发布处 | 地址 | 作用 |
|---|---|---|
| GitHub | Sophon-LLC/voice-agent-benchmark-landscape | 记录来源:数据、架构、来源审计、贡献规则、测试 |
| Zenodo | doi.org/10.5281/zenodo.22227265 | 带有 DOI 的归档版本;概念 DOI 始终解析到最新版本 |
| Hugging Face | chatjesus/voice-agent-benchmark-landscape | 数据集的镜像 |
版本
| 版本 | 日期 | 记录 | 许可证 | 版本 DOI |
|---|---|---|---|---|
| v1.0.2 | 1 September 2026 | 13 | MIT | 10.5281/zenodo.22227266 |
v1.0.2 的 Zenodo 记录包含该数据集的 SHA-256 (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4),以便将下载的副本与存档的副本进行核对。
如何引用
代码仓库的 CITATION.cff 文件将作者署名为 Sophon LLC。当需要精确复现时,请引用版本 DOI;对于不断演进的项目,请引用概念 DOI:
Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266
更正记录
更正时需遵循代码仓库的 CONTRIBUTING.md 文件,指明行、字段、建议值和第一方来源。更改将作为新版本发布,并附有新的 DOI。