”Voice agent evaluation” omfattar flera olika problem som är lätta att blanda ihop. En benchmark kan testa taligenkänning utan att testa slutförande av uppgifter, eller testa verktygsanrop utan en levande muntlig interaktion. Voice Agent Benchmark Landscape finns för att göra dessa gränser tydliga. Det här inlägget handlar om hur den byggdes.
En rad per benchmark, en fråga per fält
Datasetet har 13 rader i versionen från 1 september 2026. För varje benchmark registrerar det primärt fokus och, som separata fält, om benchmarken täcker talad indata, talad utdata, interaktion i flera omgångar, verktygsanvändning, slutförande av mål, dator- eller webbläsaråtgärd, mötes- eller långformatsmaterial och realtidsdrift. Det registrerar också om datan är offentlig, kodlicensen och datalicensen separat, adresserna till repository, dataset card och paper, datumet då det senast verifierades och anteckningar om belägg.
Varje förmågevärde är ett av fyra ord: yes, no, partial eller unclear. ”Partial” betyder att förmågan finns i en del av en svit eller utvärderas indirekt; det säger inget om kvaliteten. ”No” betyder att förmågan ligger utanför den publicerade omfattningen eller saknas i det offentliga materialet, inte att projektet aldrig skulle kunna stödja den. ”Unclear” används när det offentliga materialet var otillräckligt för att klassificera, och det står kvar tills en förstahandskälla avgör saken.
Källor är från första part, och licenser registreras två gånger
Varje rad citerar underhållarnas eget repository, dataset-kort eller artikel. Ingenting klassificeras från en sekundär källa. Källgranskningen i vårt repository listar för varje rad de sidor som stödde kapacitetsvärdena och de sidor som anger licenserna. Kod- och datalicenser registreras separat eftersom de skiljer sig åt oftare än man tror. Ett projekts kod och data ligger under en community-licens som inte är en öppen källkods-licens och som begränsar kommersiell användning. Ett annats kod är Apache-2.0 medan dess data är CC BY-NC 4,0 och åtkomstbegränsad. En läsare som avgör om ett benchmark kan återanvändas behöver båda dessa fakta.
Varför det inte finns några poäng
En topplista behöver en gemensam uppgift och ett gemensamt mått. De tretton projekten utformades för tretton olika utvärderingsfrågor, så en enda rangordning skulle jämföra saker som inte var byggda för att jämföras. Landskapet registrerar därför vad varje benchmark mäter och ingenting om hur något system presterar på det. Att ett projekt är inkluderat innebär inte att vi rekommenderar det, och datasetet innehåller inte Cues privata produktionsbenchmark med 227 exempel som beskrivs i Google DeepMinds fallstudie.
Vad kartan visar saknas
När det läggs fram på detta sätt är det offentliga landskapet starkast inom konversationell kundtjänst, val av talstyrda verktyg, utvärdering av innehåll för röstassistenter och taligenkänning. Det är tunt i skärningspunkten mellan kontinuerlig röstinmatning på datorn i godtyckliga program, transkription av långa möten med strukturerade anteckningar, datoråtgärder över flera program, bekräftelse och reversibilitet av sidoeffekter, och varje enskild utvärdering som kopplar transkriptionskvalitet till användarresultat. Vårt repository anger detta som en lucka i vad som finns, inte som en brist i något enskilt projekt.
Att hålla det ärligt
- Datafilen har ett dokumenterat schema och en validator. En rad som bryter mot fältkontraktet misslyckas i kontrollen.
- Varje källänk kontrolleras om enligt ett schema. En definitiv 404 eller 410 misslyckas i granskningen. Rate limits och tillfälliga fel rapporteras separat så att de inte felaktigt märks som trasiga länkar.
- Versioner arkiveras på Zenodo med ett DOI per version, och posten innehåller datasetets SHA-256, så en citering pekar på en exakt fil.
- Rättelser anger rad, fält, föreslaget värde och en förstahandskälla, och publiceras som en ny version.
Vårt repository finns på github.com/Sophon-LLC/voice-agent-benchmark-landscape. Citeringsformatet och versionslistan finns på postsidan.