«Voice agent evaluation» dekker flere ulike problemer som er lette å blande sammen. En benchmark kan teste talegjenkjenning uten å teste oppgavefullføring, eller teste verktøykall uten en direkte muntlig interaksjon. Voice Agent Benchmark Landscape finnes for å gjøre disse grensene tydelige. Dette innlegget handler om hvordan den ble bygget.
Én rad per benchmark, ett spørsmål per felt
Datasettet har 13 rader i utgivelsen fra 1. september 2026. For hver benchmark registrerer det hovedfokuset og, som separate felt, om benchmarken dekker muntlig input, muntlig output, interaksjon over flere runder, verktøybruk, måloppnåelse, handlinger på datamaskin eller i nettleser, møtemateriale eller langt materiale, og sanntidsdrift. Det registrerer også om dataene er offentlige, kodelisensen og datalisensen separat, adressene til repositoriet, datasettkortet og artikkelen, datoen for siste verifisering og notater om belegg.
Hver kapabilitetsverdi er ett av fire ord: yes, no, partial eller unclear. «Partial» betyr at kapabiliteten er til stede i en del av en pakke eller blir evaluert indirekte; det sier ingenting om kvalitet. «No» betyr at kapabiliteten er utenfor det publiserte omfanget eller fraværende fra det offentlige materialet, ikke at prosjektet aldri kunne støttet den. «Unclear» brukes når det offentlige materialet var utilstrekkelig for å klassifisere, og det blir stående til en førstepartskilde avgjør saken.
Kildene er fra førstepart, og lisenser registreres to ganger
Hver rad siterer vedlikeholdernes eget repository, datasettkort eller artikkel; ingenting er klassifisert fra en sekundær kilde. Kildegjennomgangen i repositoryet lister, per rad, sidene som ga belegg for kapasitetsverdiene og sidene som oppgir lisensene. Lisenser for kode og data registreres separat fordi de oftere er forskjellige enn folk tror: Én oppførings kode og data er under en felleskapslisens som ikke er en åpen kildekode-lisens og begrenser kommersiell bruk; en annens kode er Apache-2.0, mens dataene er CC BY-NC 4,0 og tilgangsstyrte. En leser som skal avgjøre om en benchmark kan gjenbrukes, trenger begge fakta.
Hvorfor det ikke er noen poengsummer
En resultatliste trenger en felles oppgave og en felles metrikk. De tretten prosjektene ble designet for tretten forskjellige evalueringsspørsmål, så en enkelt rangering ville sammenlignet ting som ikke ble bygget for å bli sammenlignet. Landskapet registrerer derfor hva hver benchmark måler, og ingenting om hvordan noe system presterer på den. Inkludering innebærer ikke en anbefaling, og datasettet inneholder ikke Cues private produksjonsbenchmark med 227 prøver, som er beskrevet i Google DeepMinds casestudie.
Hva kartet viser at mangler
Slik det er lagt frem, er det offentlige landskapet sterkest innen samtalebasert kundeservice, valg av talestyrte verktøy, innholdsevaluering for stemmeagenter og talegjenkjenning. Det er tynt i skjæringspunktet mellom kontinuerlig stemmestyrt skriving på skrivebordet i vilkårlige applikasjoner, transkripsjon av lange møter med strukturerte notater, handlinger på tvers av applikasjoner, bekreftelse og reversering av sideeffekter, og enhver enkelt evaluering som kobler transkripsjonskvalitet til brukerresultater. Repositoryet oppgir dette som et hull i det som finnes, ikke som en mangel ved noe prosjekt.
Hvordan vi holder det ærlig
- Datafilen har et dokumentert skjema og en validator; en rad som bryter feltkontrakten, vil ikke bli godkjent.
- Hver kildelenke sjekkes på nytt etter en tidsplan. En definitiv 404 eller 410 gjør at gjennomgangen mislykkes; rate-grenser og forbigående feil rapporteres separat, slik at de ikke blir feilmerket som ødelagte lenker.
- Utgivelser arkiveres på Zenodo med en DOI per versjon, og posten inneholder datasettets SHA-256, slik at en sitering peker på en nøyaktig fil.
- Rettinger navngir raden, feltet, den foreslåtte verdien og en førstepartskilde, og utgis som en ny versjon.
Repositoryet ligger på github.com/Sophon-LLC/voice-agent-benchmark-landscape; siteringsformatet og versjonslisten er på siden for posten.