“Voice agent evaluation” dækker over flere forskellige problemer, som er lette at blande sammen. En benchmark kan teste talegenkendelse uden at teste fuldførelse af opgaver, eller teste værktøjskald uden en live, talt interaktion. Voice Agent Benchmark Landscape findes for at gøre disse grænser eksplicitte. Dette indlæg handler om, hvordan det blev bygget.
Én række pr. benchmark, ét spørgsmål pr. felt
Datasættet har 13 rækker i udgivelsen fra 1. september 2026. For hver benchmark registrerer det det primære fokus og, som separate felter, om benchmarket dækker talt input, talt output, interaktion i flere omgange, brug af værktøjer, målopfyldelse, computer- eller browserhandling, møde- eller langformsmateriale og realtidsdrift. Det registrerer også, om dataene er offentlige, kodelicensen og datalicensen separat, adresser til repository, dataset card og artikel, datoen for seneste verifikation og noter med belæg.
Hver kapabilitetsværdi er et af fire ord: yes, no, partial eller unclear. “Partial” betyder, at kapabiliteten optræder i en del af en suite eller evalueres indirekte; det siger intet om kvalitet. “No” betyder, at kapabiliteten er uden for det offentliggjorte omfang eller fraværende i de offentlige materialer, ikke at projektet aldrig ville kunne understøtte den. “Unclear” bruges, når det offentlige materiale var utilstrækkeligt til at klassificere, og det forbliver, indtil en førstepartskilde afgør det.
Kilder er førsteparts, og licenser registreres to gange
Hver række citerer vedligeholdernes eget repository, datasætkort eller paper; intet er klassificeret ud fra en sekundær beskrivelse. Kilderevisionen i repositoriet oplister for hver række de sider, der understøttede kapabilitetsværdierne, og de sider, der angiver licenserne. Kode- og datalicenser registreres separat, fordi de adskiller sig oftere, end folk antager: En indgangs kode og data er under en fællesskabslicens, der ikke er en open source-licens og begrænser kommerciel brug; en andens kode er Apache-2.0, mens dens data er CC BY-NC 4,0 og adgangsbegrænset. En læser, der beslutter, om en benchmark skal genbruges, har brug for begge fakta.
Hvorfor der ikke er nogen scorer
En rangliste kræver en fælles opgave og en fælles metrik. De tretten projekter blev designet til tretten forskellige evalueringsspørgsmål, så en enkelt rangering ville sammenligne ting, der ikke var bygget til at blive sammenlignet. Landskabet registrerer derfor, hvad hver benchmark måler, og intet om, hvordan noget system klarer sig på den. Inkludering indebærer ikke en anbefaling, og datasættet indeholder ikke Cues private produktionsbenchmark med 227 prøver, som er beskrevet i Google DeepMinds casestudie.
Hvad kortet viser mangler
Når det er lagt frem på denne måde, er det offentlige landskab stærkest inden for samtalebaseret kundeservice, talt værktøjsvalg, evaluering af stemmeagent-indhold og talegenkendelse. Det er tyndt i skæringspunktet mellem kontinuerlig stemmestyret skrivning på computeren i vilkårlige applikationer, langformstransskription af møder med strukturerede noter, computerhandlinger på tværs af applikationer, bekræftelse og reversibilitet af bivirkninger og enhver enkelt evaluering, der forbinder transskriptionskvalitet med brugerresultater. Repositoriet angiver dette som et hul i det eksisterende, ikke som en defekt i noget projekt.
At holde det ærligt
- Datafilen har et dokumenteret skema og en validator; en række, der bryder feltkontrakten, fejler kontrollen.
- Hvert kildelink bliver tjekket igen efter en tidsplan. En definitiv 404 eller 410 fejler revisionen; rate limits og forbigående fejl rapporteres separat, så de ikke bliver fejlmarkeret som brudte links.
- Udgivelser arkiveres på Zenodo med et DOI pr. version, og posten indeholder datasættets SHA-256, så en henvisning peger på en præcis fil.
- Rettelser navngiver rækken, feltet, den foreslåede værdi og en førstepartskilde og udgives som en ny version.
Repositoriet findes på github.com/Sophon-LLC/voice-agent-benchmark-landscape; henvisningsformatet og versionslisten er på siden for posten.