“Voice agent evaluation” 涵盖了几个容易混淆的不同问题。一个基准测试可能会测试语音识别而不测试任务完成,或测试工具调用而没有实时口语互动。Voice Agent Benchmark Landscape 的存在就是为了明确这些界限。本文介绍它是如何构建的。
每个基准测试占一行,每个字段回答一个问题
在 2026 年 9 月 1 日的版本中,该数据集有 13 行。对于每个基准测试,它记录了主要关注点,并作为独立字段记录了该基准测试是否涵盖口语输入、口语输出、多轮交互、工具使用、目标完成、计算机或浏览器操作、会议或长篇材料以及实时操作。它还分别记录了数据是否公开、代码许可证和数据许可证、代码仓库、数据集卡片和论文地址、最后验证日期以及证据说明。
每个能力值都是四个词之一:yes、no、partial 或 unclear。“Partial”表示该能力出现在套件的一部分中或被间接评估;它不说明质量如何。“No”表示该能力超出了已发布的范围或在公开材料中缺失,而不是说该项目永远无法支持它。当公开材料不足以分类时,使用“Unclear”,并且该状态会一直保持,直到有第一方来源澄清为止。
来源为第一方,许可证被记录两次
每一行都引用了维护者自己的代码仓库、数据集卡片或论文;没有任何分类是基于二手文章的。代码仓库中的来源审计为每一行都列出了支持能力值的页面和声明许可证的页面。代码和数据许可证被分开记录,因为它们之间的差异比人们想象的更常见:一个条目的代码和数据遵循一个社区许可证,该许可证不是开源许可证且限制商业用途;另一个条目的代码是 Apache-2.0,而其数据是 CC BY-NC 4.0 且需要申请才能访问。读者在决定是否重用一个基准测试时需要了解这两个事实。
为什么没有分数
排行榜需要一个共享任务和一个共享指标。这十三个项目是为十三个不同的评估问题而设计的,因此单一排名将会比较那些并非为相互比较而构建的东西。因此,该格局只记录每个基准测试衡量什么,而不涉及任何系统在其上的表现。收录不意味着认可,并且该数据集不包含 Google DeepMind 案例研究中描述的 Cue 私有的 227 样本生产基准测试。
这张地图揭示了缺失的部分
如此看来,公开领域在对话式客户服务、口语工具选择、语音助手内容评估和语音识别方面最强。但在任意应用程序中的连续桌面语音输入、带结构化笔记的长篇会议转写、跨应用程序的计算机操作、副作用的确认与可逆性,以及任何将转写质量与用户成果联系起来的单一评估等交叉领域则较为薄弱。该存储库指出,这是现有技术中的一个空白,而非任何项目的缺陷。
保持真实
- 数据文件有文档化的模式和验证器;违反字段约定的行将无法通过检查。
- 每个源链接都会按计划重新检查。明确的 404 或 410 错误会导致审核失败;速率限制和暂时性错误会单独报告,以免被误标为损坏的链接。
- 发布版本在 Zenodo 上存档,每个版本都有一个 DOI,记录中包含数据集的 SHA-256,因此引用会指向一个确切的文件。
- 更正时需指明行、字段、建议值和第一方来源,并作为新版本发布。
该存储库位于 github.com/Sophon-LLC/voice-agent-benchmark-landscape;引用格式和版本列表在记录页面上。