Dokumentasyon · Patunay

Voice Agent Benchmark Landscape: talaan at pagsipi

Kung ano ang dataset at kung ano ang hindi, kung saan ito naka-publish, ang mga bersiyon, lisensiya, at DOI nito, at kung paano ito sipiin. Pinapanatili ng Sophon LLC.

Inilathala noong · In-update noong

Ang Voice Agent Benchmark Landscape ay isang dataset na aming inilalathala: isang nakabalangkas na mapa ng mga pampublikong benchmark para sa mga voice agent, spoken assistant, speech-enabled tool use, computer action, speech recognition, at meeting understanding. Ang pahinang ito ang talaan ng paglalathala nito.

Kung ano ito

  • 13 benchmark, isang row bawat isa, sa isang machine-readable file (data/benchmarks.jsonl) na may dokumentadong field contract (data/schema.json).
  • Itinatala ng bawat row ang pangunahing pokus ng benchmark; kung saklaw nito ang spoken input, spoken output, multi-turn interaction, tool use, goal completion, computer o browser action, meeting o long-form material, at real-time operation; kung pampubliko ang data; ang mga lisensiya ng code at data, na magkahiwalay na itinala; ang mga address ng repository, dataset card, at papel; ang petsa kung kailan huling na-verify; at mga tala ng patunay.
  • Ang mga value ay yes, no, partial, o unclear. Ang ibig sabihin ng partial ay lumalabas ang kakayahan sa isang bahagi ng suite o hindi direktang sinusuri; hindi nito inilalarawan ang kalidad.
  • Bawat row ay may kahit isang first-party source, na nakalista sa source audit. Ang mga katotohanan sa kasalukuyang release ay na-verify noong 1 Setyembre 2026 mula sa mga pampublikong repository, dataset card, at papel ng mga maintainer.

Ano ang hindi kasama rito

  • Hindi isang leaderboard. Wala itong nilalamang mga score at walang iniraranggo. Ang pagkakasama ay hindi nangangahulugang pag-eendorso. Kung bakit ito ginawa sa ganoong paraan ay nasa Kung paano binuo ang voice-agent benchmark landscape.
  • Hindi isang evaluation framework. Walang maaaring patakbuhin laban sa isang modelo; naglalaman ang repository ng data, schema nito, isang validator, at isang query tool.
  • Hindi benchmark ng Cue. Ang pribadong 227-sample production benchmark na inilarawan sa case study ng Google DeepMind ay hindi bahagi nito.

Saan ito inilathala

SaanAddressPapel
GitHubSophon-LLC/voice-agent-benchmark-landscapeSource of record: data, schema, source audit, mga panuntunan sa kontribusyon, mga test
Zenododoi.org/10.5281/zenodo.22227265Mga naka-archive na release na may mga DOI; laging sa pinakabagong bersiyon nagre-resolve ang concept DOI.
Hugging Facechatjesus/voice-agent-benchmark-landscapeMirror ng dataset.

Mga Bersiyon

BersiyonPetsaMga RecordLisensiyaDOI ng Bersiyon
v1.0.21 Setyembre 202613MIT10.5281/zenodo.22227266

Nasa Zenodo record para sa v1.0.2 ang SHA-256 ng dataset (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4) para masuri kung ang na-download na kopya ay tugma sa naka-archive.

Paano mag-cite

Pinapangalanan ng CITATION.cff ng repository ang Sophon LLC bílang may-akda. I-cite ang DOI ng bersiyon kapag mahalaga ang eksaktong reproducibility at ang concept DOI para sa nagbabagong proyekto:

Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266

Mga Pagwawasto

Sa isang pagwawasto, pinapangalanan ang row, ang field, ang iminumungkahing value, at ang isang first-party source, alinsunod sa CONTRIBUTING.md ng repository. Inilalabas ang mga pagbabago bílang bagong bersiyon na may bagong DOI.

May mali ba sa pahinang ito? feedback@sophoninc.com