Saklaw ng “Voice agent evaluation” ang ilang magkakaibang problema na madaling pag-isahin. Maaaring subukan ng isang benchmark ang speech recognition nang hindi sinusubukan ang pagkumpleto ng gawain, o subukan ang mga tool call nang walang live na pasalitang interaksyon. Umiiral ang Voice Agent Benchmark Landscape upang gawing malinaw ang mga hangganang iyon. Ang post na ito ay tungkol sa kung paano ito binuo.
Isang row bawat benchmark, isang tanong bawat field
Ang dataset ay may 13 row sa release ng 1 Setyembre 2026. Para sa bawat benchmark, itinatala nito ang pangunahing pokus at, bilang magkakahiwalay na field, kung saklaw ng benchmark ang spoken input, spoken output, multi-turn interaction, tool use, goal completion, computer or browser action, meeting or long-form material, at real-time operation. Itinatala rin nito kung pampubliko ang data, ang lisensya ng code at ang lisensya ng data nang hiwalay, ang mga address ng repository, dataset card at papel, ang petsa kung kailan huling na-verify, at mga tala ng patunay.
Ang bawat halaga ng kakayahan ay isa sa apat na salita: yes, no, partial o unclear. Ang “Partial” ay nangangahulugang lumalabas ang kakayahan sa isang bahagi ng isang suite o sinusuri nang hindi direkta; wala itong sinasabi tungkol sa kalidad. Ang “No” ay nangangahulugang ang kakayahan ay nasa labas ng nai-publish na saklaw o wala sa mga pampublikong materyales, hindi na hindi ito kailanman masusuportahan ng proyekto. Ginagamit ang “Unclear” kapag hindi sapat ang pampublikong materyal para sa pag-uuri, at mananatili ito hanggang sa ayusin ito ng isang first-party source.
Ang mga source ay first-party, at ang mga lisensya ay itinatala nang dalawang beses
Binabanggit sa bawat row ang sariling repository, dataset card, o paper ng mga maintainer; walang inuuri mula sa pangalawang ulat. Inililista ng source audit sa repository, sa bawat row, ang mga pahinang sumuporta sa mga capability value at ang mga pahinang nagsasaad ng mga lisensiya. Magkahiwalay na itinatala ang mga lisensiya ng code at data dahil mas madalas silang magkaiba kaysa sa inaakala ng mga tao: ang code at data ng isang entry ay nasa ilalim ng isang community licence na hindi open-source na lisensiya at naghihigpit sa komersiyal na paggamit; ang code naman ng isa pa ay Apache-2.0 habang ang data nito ay CC BY-NC 4.0 at gated. Kailangan ng isang mambabasa na nagpapasya kung muling gagamitin ang isang benchmark ang parehong impormasyon.
Bakit walang mga score
Nangangailangan ang isang leaderboard ng isang shared task at isang shared metric. Idinisenyo ang labintatlong proyekto para sa labintatlong magkakaibang tanong sa ebalwasyon, kaya't ang iisang ranking ay maghahambing ng mga bagay na hindi ginawa upang paghambingin. Samakatuwid, itinatala ng landscape kung ano ang sinusukat ng bawat benchmark at wala tungkol sa kung paano gumagana ang anumang system dito. Hindi nangangahulugan ng pag-endorso ang pagkakasama, at hindi naglalaman ang dataset ng pribadong 227-sample production benchmark ng Cue na inilarawan sa case study ng Google DeepMind.
Ano ang ipinapakitang kulang sa mapa
Kapag inilatag sa ganitong paraan, ang pampublikong landscape ay pinakamalakas sa conversational customer service, spoken tool selection, voice-assistant content evaluation, at speech recognition. Manipis ito sa interseksiyon ng tuloy-tuloy na desktop voice typing sa anumang application, long-form meeting transcription na may structured notes, cross-application computer action, kumpirmasyon at reversibility ng mga side effect, at anumang iisang ebalwasyon na nag-uugnay sa kalidad ng transcription sa mga resulta para sa user. Isinasaad ng repository na ito ay isang puwang sa kung ano ang umiiral, hindi bilang isang depekto sa anumang proyekto.
Pagpapanatili nitong tapat
- Ang data file ay may dokumentadong schema at isang validator; ang isang row na lumalabag sa field contract ay hindi papasa sa check.
- Muling sinusuri ang bawat source link ayon sa isang iskedyul. Ang isang tiyak na 404 o 410 ay hindi papasa sa audit; hiwalay na inuulat ang mga rate limit at mga pansamantalang error upang hindi sila mamali bilang mga sirang link.
- Naka-archive ang mga release sa Zenodo na may DOI sa bawat bersiyon, at dala ng record ang SHA-256 ng dataset, kaya't tumuturo ang isang citation sa isang eksaktong file.
- Tinutukoy ng mga pagwawasto ang row, ang field, ang iminumungkahing value, at isang first-party source, at inilalabas bilang isang bagong bersiyon.
Ang repository ay nasa github.com/Sophon-LLC/voice-agent-benchmark-landscape; ang format ng citation at listahan ng bersiyon ay nasa pahina ng record.