Blog

Hoe het benchmarklandschap voor spraakagenten is opgebouwd, en waarom het geen scorebord is

Dertien publieke benchmarks, één rij per stuk, met dekkingsgraad van capaciteiten en licenties uit eerstehands bronnen. Wat de dataset beantwoordt en wat niet.

Gepubliceerd op

“Voice agent evaluation” omvat verschillende problemen die je makkelijk door elkaar haalt. Een benchmark kan spraakherkenning testen zonder de taakvoltooiing te testen, of tool-aanroepen testen zonder een live gesproken interactie. De Voice Agent Benchmark Landscape bestaat om die grenzen expliciet te maken. Dit bericht gaat over hoe die is opgebouwd.

Eén rij per benchmark, één vraag per veld

De dataset heeft 13 rijen in de release van 1 september 2026. Voor elke benchmark registreert het de primaire focus en, als afzonderlijke velden, of de benchmark gesproken invoer, gesproken uitvoer, interactie over meerdere beurten, toolgebruik, doelvoltooiing, computer- of browseracties, vergaderingen of lang materiaal, en realtime werking dekt. Het registreert ook of de data publiek is, de codelicentie en de datalicentie afzonderlijk, de adressen van de repository, dataset-kaart en paper, de datum van laatste verificatie, en notities met bewijs.

Elke capaciteitswaarde is een van vier woorden: yes, no, partial of unclear. “Partial” betekent dat de capaciteit in een deel van een suite voorkomt of indirect wordt geëvalueerd; het zegt niets over de kwaliteit. “No” betekent dat de capaciteit buiten de gepubliceerde scope valt of ontbreekt in het openbare materiaal, niet dat het project die nooit zou kunnen ondersteunen. “Unclear” wordt gebruikt als het openbare materiaal onvoldoende was om te classificeren, en blijft staan totdat een bron van de eerste partij er uitsluitsel over geeft.

Bronnen zijn eerstehands, en licenties worden dubbel genoteerd

Elke rij citeert de eigen repository, dataset-kaart of paper van de onderhouders; niets wordt geclassificeerd op basis van een secundaire beschrijving. De bronnenaudit in de repository vermeldt per rij de pagina's die de capaciteitswaarden ondersteunden en de pagina's die de licenties vermelden. Code- en datalicenties worden afzonderlijk genoteerd omdat ze vaker verschillen dan men aanneemt: de code en data van één item vallen onder een communitylicentie die geen open-sourcelicentie is en commercieel gebruik beperkt; de code van een ander is Apache-2.0 terwijl de data CC BY-NC 4,0 is en achter een poort zit. Een lezer die beslist of hij een benchmark wil hergebruiken, heeft beide feiten nodig.

Waarom er geen scores zijn

Een scorebord vereist een gedeelde taak en een gedeelde meetwaarde. De dertien projecten zijn ontworpen voor dertien verschillende evaluatievragen, dus een enkele ranglijst zou dingen vergelijken die niet zijn gebouwd om te worden vergeleken. Het landschap registreert daarom wat elke benchmark meet en niets over hoe een systeem erop presteert. Opname impliceert geen goedkeuring, en de dataset bevat niet de private 227-sample productiebenchmark van Cue die wordt beschreven in de casestudy van Google DeepMind.

Wat de kaart laat zien dat ontbreekt

Zo uitgestald is het publieke landschap het sterkst in conversationele klantenservice, gesproken toolselectie, evaluatie van content voor spraakassistenten en spraakherkenning. Het is dun op het snijvlak van continu spraakgestuurd typen op de desktop in willekeurige applicaties, transcriptie van lange vergaderingen met gestructureerde notities, applicatie-overstijgende computeracties, bevestiging en omkeerbaarheid van neveneffecten, en elke afzonderlijke evaluatie die transcriptiekwaliteit verbindt met gebruikersresultaten. De repository stelt dat dit een leemte is in wat er bestaat, niet een gebrek in een specifiek project.

Hoe we het eerlijk houden

  • Het databestand heeft een gedocumenteerd schema en een validator; een rij die het veldcontract schendt, doorstaat de controle niet.
  • Elke bronlink wordt volgens een schema opnieuw gecontroleerd. Een definitieve 404 of 410 doorstaat de audit niet; rate limits en tijdelijke fouten worden apart gerapporteerd zodat ze niet verkeerd als gebroken links worden bestempeld.
  • Releases worden gearchiveerd op Zenodo met een DOI per versie, en de record bevat de SHA-256 van de dataset, zodat een citatie naar een exact bestand verwijst.
  • Correcties noemen de rij, het veld, de voorgestelde waarde en een eerstehands bron, en worden als een nieuwe versie uitgebracht.

De repository staat op github.com/Sophon-LLC/voice-agent-benchmark-landscape; het citatieformaat en de versielijst staan op de recordpagina.

Alle posts