Blogi

Kuidas loodi häälagentide benchmark'ide maastik ja miks see ei ole edetabel

Kolmteist avalikku benchmark'i, igaüks ühel real, koos võimekuste katvuse ja litsentsidega esmastest allikatest. Mida andmestik vastab ja millele keeldub vastamast.

Avaldatud

„Voice agent evaluation“ hõlmab mitut erinevat probleemi, mida on lihtne segi ajada. Benchmark võib testida kõnetuvastust, kuid mitte ülesande täitmist, või testida tööriistakutseid ilma reaalajas suulise suhtluseta. Voice Agent Benchmark Landscape on loodud nende piiride selgitamiseks. See postitus räägib, kuidas see loodi.

Üks rida benchmark'i kohta, üks küsimus välja kohta

Andmestikus on 1. septembri 2026. aasta versioonis 13 rida. Iga benchmark'i kohta on kirjas peamine fookus ja eraldi väljadena, kas benchmark hõlmab suulist sisendit, suulist väljundit, mitmevoorulist suhtlust, tööriistade kasutamist, eesmärgi saavutamist, arvuti või brauseri tegevust, koosoleku või pika vormiga materjali ja reaalajas toimimist. Samuti on kirjas, kas andmed on avalikud, eraldi koodi- ja andmelitsents, repositooriumi, andmestikukaardi ja teadusartikli aadressid, viimase kontrollimise kuupäev ja tõendite märkused.

Iga võimekuse väärtus on üks neljast sõnast: yes, no, partial või unclear. „Partial“ tähendab, et võimekus esineb komplekti osas või seda hinnatakse kaudselt; see ei ütle midagi kvaliteedi kohta. „No“ tähendab, et võimekus jääb avaldatud ulatusest välja või puudub avalikest materjalidest, mitte et projekt ei saaks seda kunagi toetada. „Unclear“ kasutatakse siis, kui avalikest materjalidest ei piisanud liigitamiseks, ja see jääb kehtima, kuni esmane allikas asja selgitab.

Allikad on esmased ja litsentsid on kirjas kaks korda

Iga rida viitab haldajate enda repositooriumile, andmestiku kaardile või teadustööle; midagi ei ole klassifitseeritud teisese kirjelduse põhjal. Repositooriumis olev allikate audit loetleb iga rea kohta leheküljed, mis toetasid võimekuse väärtusi, ja leheküljed, kus on litsentsid kirjas. Koodi ja andmete litsentsid on märgitud eraldi, sest need erinevad sagedamini, kui arvatakse: ühe kirje kood ja andmed on kogukonna litsentsi all, mis ei ole avatud lähtekoodiga litsents ja piirab ärilist kasutust; teise kood on Apache-2.0 litsentsiga, samas kui selle andmed on CC BY-NC 4,0 ja piiratud juurdepääsuga. Lugeja, kes otsustab, kas benchmarki taaskasutada, vajab mõlemat fakti.

Miks skoore ei ole

Edetabel vajab ühist ülesannet ja ühist mõõdikut. Kolmteist projekti olid loodud kolmeteistkümne erineva hindamisküsimuse jaoks, seega võrdleks üksainus pingerida asju, mida ei loodud võrdlemiseks. Seetõttu kajastab ülevaade seda, mida iga benchmark mõõdab, ja mitte midagi selle kohta, kuidas mõni süsteem sellel toimib. Kaasamine ei tähenda heakskiitu ja andmestik ei sisalda Cue privaatset 227 valimiga tootmis-benchmarki, mida on kirjeldatud Google DeepMindi juhtumiuuringus.

Mida kaart näitab puudu olevat

Niimoodi esitatuna on avalik maastik kõige tugevam vestluspõhise klienditeeninduse, kõnepõhise tööriistavaliku, häälassistendi sisu hindamise ja kõnetuvastuse valdkonnas. See on hõre pideva töölaua häälsisestuse suvalistes rakendustes, pikaajalise koosolekute transkriptsiooni koos struktureeritud märkmetega, rakendusteülese arvutitegevuse, kõrvalmõjude kinnitamise ja tagasipööramise ning mis tahes üksiku hindamise ristumiskohas, mis seob transkriptsiooni kvaliteedi kasutaja tulemustega. Repositooriumis on see märgitud kui lünk olemasolevas, mitte kui defekt mõnes projektis.

Aususe hoidmine

  • Andmefailil on dokumenteeritud skeem ja valideerija; rida, mis rikub väljade lepingut, ei läbi kontrolli.
  • Iga allika linki kontrollitakse regulaarselt uuesti. Lõplik 404 või 410 ei läbi auditit; päringulimiidid ja ajutised vead raporteeritakse eraldi, et neid ei märgistataks valesti kui katkiseid linke.
  • Väljaanded arhiveeritakse Zenodos DOI-ga iga versiooni kohta ja kirje sisaldab andmestiku SHA-256, nii et viide osutab täpsele failile.
  • Parandustes nimetatakse rida, väli, pakutud väärtus ja esmase osapoole allikas ning need avaldatakse uue versioonina.

Repositoorium asub aadressil github.com/Sophon-LLC/voice-agent-benchmark-landscape; viitamise vorming ja versioonide loend on kirje lehel.

Kõik postitused