„Voice agent evaluation“ nær yfir nokkur ólík vandamál sem auðvelt er að rugla saman. Benchmark getur prófað talgreiningu án þess að prófa verklok, eða prófað kall á verkfæri án lifandi munnlegra samskipta. Voice Agent Benchmark Landscape er til þess að gera þessi mörk skýr. Þessi færsla fjallar um hvernig það var byggt.
Ein röð fyrir hvert benchmark, ein spurning fyrir hvern reit
Gagnasafnið hefur 13 raðir í útgáfunni frá 1. september 2026. Fyrir hvert benchmark er skráð aðaláhersla þess og, í aðskildum reitum, hvort það nái yfir munnlegt inntak, munnlegt úttak, samskipti í mörgum umferðum, tólnotkun, verklok, aðgerðir í tölvu eða vafra, fundi eða langt efni og rauntímavirkni. Einnig er skráð hvort gögnin séu opinber, leyfi fyrir kóða og leyfi fyrir gögnum sérstaklega, slóðir á kóðasafn, gagnasafnskort og fræðigrein, dagsetning síðustu staðfestingar og sönnunarskýringar.
Sérhvert gildi um færni er eitt af fjórum orðum: yes, no, partial eða unclear. „Partial“ þýðir að færnin er til staðar í hluta af heild eða er metin óbeint; það segir ekkert um gæði. „No“ þýðir að færnin er utan yfirlýsts gildissviðs eða er ekki að finna í opinberum gögnum, ekki að verkefnið gæti aldrei stutt hana. „Unclear“ er notað þegar opinber gögn dugðu ekki til flokkunar, og er notað þar til aðili sem tengist verkefninu beint skerst í leikinn.
Heimildir eru frá fyrsta aðila og leyfi eru skráð tvisvar
Hver röð vitnar í eigin gagnageymslu, gagnasafnskort eða ritrýnda grein viðhaldsaðila; ekkert er flokkað út frá annars stigs umfjöllun. Heimildaúttektin í gagnageymslunni telur upp, fyrir hverja röð, síðurnar sem studdu við gildin um getu og síðurnar sem tilgreina leyfin. Leyfi fyrir kóða og gögn eru skráð sérstaklega því þau eru oftar ólík en fólk gerir ráð fyrir: kóði og gögn einnar færslu eru undir samfélagsleyfi sem er ekki opinn hugbúnaður og takmarkar notkun í viðskiptaskyni; kóði annarrar er Apache-2.0 á meðan gögnin eru CC BY-NC 4,0 og með aðgangsstýringu. Lesandi sem ákveður hvort endurnýta eigi benchmark þarf báðar staðreyndirnar.
Af hverju það eru engin skor
Stigatafla þarf sameiginlegt verkefni og sameiginlegan mælikvarða. Þessi þrettán verkefni voru hönnuð fyrir þrettán mismunandi matspurningar og því myndi ein röðun bera saman hluti sem voru ekki byggðir til að vera bornir saman. Yfirlitið skráir því hvað hvert benchmark mælir en ekkert um það hvernig nokkurt kerfi stendur sig á því. Meðtaka felur ekki í sér meðmæli og gagnasafnið inniheldur ekki einka-benchmark Cue með 227 sýnum sem lýst er í tilviksrannsókn Google DeepMind.
Hvað kortið sýnir að vantar
Þegar það er sett svona upp er hið opinbera landslag sterkast í samtalsþjónustu við viðskiptavini, raddstýrðu tækjavali, efnisúttekt fyrir raddaðstoðarmenn og talgreiningu. Það er þunnt á mótum samfelldrar raddinnsláttar á skjáborði í hvaða forriti sem er, afritun langra funda með skipulögðum minnispunktum, tölvuaðgerðum þvert á forrit, staðfestingu og afturkræfni aukaverkana og hvers kyns stakri úttekt sem tengir gæði afritunar við útkomu fyrir notendur. Gagnageymslan segir þetta vera eyðu í því sem er til, ekki galla í neinu verkefni.
Að halda þessu heiðarlegu
- Gagnaskráin hefur skjalfest skema og prófara; röð sem brýtur í bága við samning reitsins stenst ekki prófið.
- Sérhver heimildatengill er yfirfarinn aftur samkvæmt áætlun. Endanleg 404 eða 410 villa fellur á úttektinni; takmörkun á tíðni og tímabundnar villur eru tilkynntar sérstaklega svo þær séu ekki ranglega merktar sem rofnir tenglar.
- Útgáfur eru vistaðar í skjalasafni á Zenodo með DOI fyrir hverja útgáfu og skráin geymir SHA-256 gagnasafnsins, þannig að tilvitnun vísar í nákvæma skrá.
- Leiðréttingar nefna röðina, reitinn, fyrirhugað gildi og heimild frá fyrsta aðila og eru gefnar út sem ný útgáfa.
Gagnageymslan er á github.com/Sophon-LLC/voice-agent-benchmark-landscape; tilvitnunarsniðið og útgáfulistinn eru á skráningarsíðunni.