Ang Voice Agent Benchmark Landscape ay isang dataset na aming inilalathala: isang nakabalangkas na mapa ng mga pampublikong benchmark para sa mga voice agent, spoken assistant, speech-enabled tool use, computer action, speech recognition, at meeting understanding. Ang pahinang ito ang talaan ng paglalathala nito.
Kung ano ito
- 13 benchmark, isang row bawat isa, sa isang machine-readable file (data/benchmarks.jsonl) na may dokumentadong field contract (data/schema.json).
- Itinatala ng bawat row ang pangunahing pokus ng benchmark; kung saklaw nito ang spoken input, spoken output, multi-turn interaction, tool use, goal completion, computer o browser action, meeting o long-form material, at real-time operation; kung pampubliko ang data; ang mga lisensiya ng code at data, na magkahiwalay na itinala; ang mga address ng repository, dataset card, at papel; ang petsa kung kailan huling na-verify; at mga tala ng patunay.
- Ang mga value ay yes, no, partial, o unclear. Ang ibig sabihin ng partial ay lumalabas ang kakayahan sa isang bahagi ng suite o hindi direktang sinusuri; hindi nito inilalarawan ang kalidad.
- Bawat row ay may kahit isang first-party source, na nakalista sa source audit. Ang mga katotohanan sa kasalukuyang release ay na-verify noong 1 Setyembre 2026 mula sa mga pampublikong repository, dataset card, at papel ng mga maintainer.
Ano ang hindi kasama rito
- Hindi isang leaderboard. Wala itong nilalamang mga score at walang iniraranggo. Ang pagkakasama ay hindi nangangahulugang pag-eendorso. Kung bakit ito ginawa sa ganoong paraan ay nasa Kung paano binuo ang voice-agent benchmark landscape.
- Hindi isang evaluation framework. Walang maaaring patakbuhin laban sa isang modelo; naglalaman ang repository ng data, schema nito, isang validator, at isang query tool.
- Hindi benchmark ng Cue. Ang pribadong 227-sample production benchmark na inilarawan sa case study ng Google DeepMind ay hindi bahagi nito.
Saan ito inilathala
| Saan | Address | Papel |
|---|---|---|
| GitHub | Sophon-LLC/voice-agent-benchmark-landscape | Source of record: data, schema, source audit, mga panuntunan sa kontribusyon, mga test |
| Zenodo | doi.org/10.5281/zenodo.22227265 | Mga naka-archive na release na may mga DOI; laging sa pinakabagong bersiyon nagre-resolve ang concept DOI. |
| Hugging Face | chatjesus/voice-agent-benchmark-landscape | Mirror ng dataset. |
Mga Bersiyon
| Bersiyon | Petsa | Mga Record | Lisensiya | DOI ng Bersiyon |
|---|---|---|---|---|
| v1.0.2 | 1 Setyembre 2026 | 13 | MIT | 10.5281/zenodo.22227266 |
Nasa Zenodo record para sa v1.0.2 ang SHA-256 ng dataset (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4) para masuri kung ang na-download na kopya ay tugma sa naka-archive.
Paano mag-cite
Pinapangalanan ng CITATION.cff ng repository ang Sophon LLC bílang may-akda. I-cite ang DOI ng bersiyon kapag mahalaga ang eksaktong reproducibility at ang concept DOI para sa nagbabagong proyekto:
Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266
Mga Pagwawasto
Sa isang pagwawasto, pinapangalanan ang row, ang field, ang iminumungkahing value, at ang isang first-party source, alinsunod sa CONTRIBUTING.md ng repository. Inilalabas ang mga pagbabago bílang bagong bersiyon na may bagong DOI.