“Voice agent evaluation” dek verskeie verskillende probleme wat maklik verwar kan word. 'n Benchmark kan spraakherkenning toets sonder om taakvoltooiing te toets, of gereedskapoproepe toets sonder 'n lewendige gesproke interaksie. Die Voice Agent Benchmark Landscape bestaan om daardie grense eksplisiet te maak. Hierdie plasing gaan oor hoe dit gebou is.
Een ry per benchmark, een vraag per veld
Die datastel het 13 rye in die 1 September 2026-vrystelling. Vir elke benchmark teken dit die primêre fokus aan en, as aparte velde, of die benchmark gesproke insette, gesproke uitsette, multibeurt-interaksie, gereedskapgebruik, doelwitvoltooiing, rekenaar- of blaaieraksie, vergadering- of langvormmateriaal, en intydse werking dek. Dit teken ook aan of die data publiek is, die kodelisensie en die datalisensie afsonderlik, die bewaarplek-, datastelkaart- en verhandelingadresse, die datum wat laas geverifieer is, en bewysnotas.
Elke vermoëwaarde is een van vier woorde: yes, no, partial of unclear. “Partial” beteken die vermoë verskyn in 'n deel van 'n suite of word indirek geëvalueer; dit sê niks oor kwaliteit nie. “No” beteken die vermoë is buite die gepubliseerde omvang of afwesig in die openbare materiaal, nie dat die projek dit nooit sou kon ondersteun nie. “Unclear” word gebruik wanneer die openbare materiaal onvoldoende was om te klassifiseer, en dit bly so totdat 'n eerstepartybron dit besleg.
Bronne is eersteparty, en lisensies word twee keer aangeteken
Elke ry haal die onderhouers se eie bewaarplek, datastelkaart of referaat aan; niks word uit 'n sekondêre opsomming geklassifiseer nie. Die bronoudit in die bewaarplek lys per ry die bladsye wat die vermoëwaardes ondersteun het en die bladsye wat die lisensies vermeld. Kode- en datalisensies word apart aangeteken omdat hulle meer dikwels verskil as wat mense aanneem: een inskrywing se kode en data is onder 'n gemeenskapslisensie wat nie 'n oopbronlisensie is nie en kommersiële gebruik beperk; 'n ander se kode is Apache-2.0 terwyl sy data CC BY-NC 4,0 en toegangsbeperk is. 'n Leser wat besluit of hy 'n benchmark wil hergebruik, het albei feite nodig.
Hoekom daar geen tellings is nie
'n Ranglys het 'n gedeelde taak en 'n gedeelde metriek nodig. Die dertien projekte is vir dertien verskillende evalueringsvrae ontwerp, so 'n enkele rangorde sou dinge vergelyk wat nie gebou is om vergelyk te word nie. Die landskap teken dus aan wat elke benchmark meet en niks oor hoe enige stelsel daarop presteer nie. Insluiting impliseer nie onderskrywing nie, en die datastel bevat nie Cue se private 227-monster-produksiebenchmark wat in Google DeepMind se gevallestudie beskryf word nie.
Wat die kaart wys ontbreek
So uiteengesit, is die openbare landskap die sterkste in gesprekskliëntediens, gesproke nutsmiddelkeuse, stemagent-inhoudevaluering en spraakherkenning. Dit is yl by die kruising van deurlopende stemtik op die rekenaar in arbitrêre toepassings, langvorm-vergaderingtranskripsie met gestruktureerde notas, rekenaaraksie oor verskeie toepassings heen, bevestiging en omkeerbaarheid van newe-effekte, en enige enkele evaluering wat transkripsiekwaliteit aan gebruikeruitkomste koppel. Die bewaarplek stel dit as 'n leemte in wat bestaan, nie as 'n gebrek in enige projek nie.
Om dit eerlik te hou
- Die datalêer het 'n gedokumenteerde skema en 'n valideerder; 'n ry wat die veldkontrak verbreek, druip die toets.
- Elke bronskakel word op 'n skedule hernagegaan. 'n Definitiewe 404 of 410 druip die oudit; tempobeheer en kortstondige foute word apart gerapporteer sodat hulle nie verkeerdelik as gebroke skakels geëtiketteer word nie.
- Vrystellings word op Zenodo geargiveer met 'n DOI per weergawe, en die rekord dra die datastel se SHA-256, sodat 'n aanhaling na 'n presiese lêer wys.
- Regstellings noem die ry, die veld, die voorgestelde waarde en 'n eerstepartybron, en word as 'n nuwe weergawe uitgereik.
Die bewaarplek is by github.com/Sophon-LLC/voice-agent-benchmark-landscape; die aanhalingformaat en weergawelys is op die rekordbladsy.