Blogi

Miten puheagenttien benchmark-kokoelma rakennettiin ja miksi se ei ole tulostaulu

Kolmetoista julkista benchmarkia, yksi rivi kutakin, sekä kyvykkyyksien kattavuus ja lisenssitiedot ensisijaisista lähteistä. Mihin datajoukko vastaa ja mihin se kieltäytyy vastaamasta.

Julkaistu

”Voice agent evaluation” kattaa useita eri ongelmia, jotka on helppo sekoittaa keskenään. Benchmark voi testata puheentunnistusta testaamatta tehtävän suorittamista tai työkalukutsuja ilman reaaliaikaista puhevuorovaikutusta. Voice Agent Benchmark Landscape on olemassa tekemään nämä rajat selviksi. Tämä kirjoitus kertoo, miten se rakennettiin.

Yksi rivi per benchmark, yksi kysymys per kenttä

Datajoukossa on 13 riviä 1. syyskuuta 2026 julkaistussa versiossa. Kunkin benchmarkin osalta se tallentaa pääpainopisteen ja erillisinä kenttinä sen, kattaako benchmark puhutun syötteen, puhutun tulosteen, monivuoroisen vuorovaikutuksen, työkalujen käytön, tavoitteen saavuttamisen, tietokoneen tai selaimen toiminnot, kokous- tai pitkän muodon materiaalin ja reaaliaikaisen toiminnan. Se tallentaa myös, onko data julkista, koodin ja datan lisenssit erikseen, arkiston, datajoukkokortin ja julkaisun osoitteet, viimeisimmän tarkistuspäivän ja näyttöä koskevat muistiinpanot.

Jokainen kyvykkyyden arvo on yksi neljästä sanasta: yes, no, partial tai unclear. ”Partial” tarkoittaa, että kyvykkyys esiintyy osassa kokonaisuutta tai sitä arvioidaan epäsuorasti; se ei kerro mitään laadusta. ”No” tarkoittaa, että kyvykkyys on julkaistun soveltamisalan ulkopuolella tai puuttuu julkisista materiaaleista, ei sitä, että projekti ei voisi koskaan tukea sitä. ”Unclear” käytetään, kun julkinen materiaali ei riittänyt luokitteluun, ja se säilyy, kunnes ensisijainen lähde ratkaisee asian.

Lähteet ovat ensisijaisia, ja lisenssit on merkitty kahdesti

Jokaisella rivillä viitataan ylläpitäjien omaan arkistoon, data-aineiston korttiin tai julkaisuun; mitään ei ole luokiteltu toissijaisen selosteen perusteella. Arkiston lähdekooditarkastus luettelee rivi kerrallaan sivut, jotka tukivat ominaisuusarvoja, ja sivut, joilla lisenssit ilmoitetaan. Koodin ja datan lisenssit on kirjattu erikseen, koska ne eroavat toisistaan useammin kuin oletetaan: yhden merkinnän koodi ja data ovat yhteisölisenssin alaisia, joka ei ole avoimen lähdekoodin lisenssi ja rajoittaa kaupallista käyttöä; toisen koodi on Apache-2.0-lisenssillä, kun taas sen data on CC BY-NC 4,0 -lisenssillä ja portin takana. Lukija, joka päättää benchmarkin uudelleenkäytöstä, tarvitsee molemmat tiedot.

Miksi pistemääriä ei ole

Tulostaulu vaatii yhteisen tehtävän ja yhteisen mittarin. Kolmetoista projektia suunniteltiin kolmeatoista eri arviointikysymystä varten, joten yksi ainoa sijoitus vertailisi asioita, joita ei ole rakennettu vertailtaviksi. Maisemakartta kirjaa siksi, mitä kukin benchmark mittaa, eikä mitään siitä, miten mikään järjestelmä suoriutuu siinä. Mukanaolo ei merkitse hyväksyntää, eikä data-aineisto sisällä Cuen yksityistä 227 näytteen tuotantobenchmarkia, jota kuvataan Google DeepMindin tapaustutkimuksessa.

Mitä kartta osoittaa puuttuvan

Tällä tavoin esitettynä julkinen maisema on vahvin keskustelevassa asiakaspalvelussa, puhutussa työkalun valinnassa, puheagentin sisällön arvioinnissa ja puheentunnistuksessa. Se on ohut jatkuvan työpöydän puhekirjoituksen mielivaltaisissa sovelluksissa, pitkien kokousten litteroinnin ja jäsenneltyjen muistiinpanojen, sovellusten välisen tietokonetoiminnan, sivuvaikutusten vahvistamisen ja peruttavuuden sekä minkä tahansa yksittäisen arvioinnin, joka yhdistää litteroinnin laadun käyttäjätuloksiin, leikkauspisteessä. Arkistossa todetaan tämän olevan aukko olemassa olevassa, ei vika missään projektissa.

Rehellisyyden ylläpitäminen

  • Datatiedostolla on dokumentoitu skeema ja validaattori; rivi, joka rikkoo kenttäsopimusta, epäonnistuu tarkistuksessa.
  • Jokainen lähdelinkki tarkistetaan uudelleen aikataulun mukaisesti. Lopullinen 404 tai 410 epäonnistuu tarkastuksessa; käyttörajoitukset ja väliaikaiset virheet raportoidaan erikseen, jotta niitä ei leimata virheellisesti rikkinäisiksi linkeiksi.
  • Julkaisut arkistoidaan Zenodoon, ja jokaisella versiolla on oma DOI-tunnus. Tietue sisältää data-aineiston SHA-256-tunnisteen, joten viittaus osoittaa tarkkaan tiedostoon.
  • Korjauksissa nimetään rivi, kenttä, ehdotettu arvo ja ensisijainen lähde, ja ne toimitetaan uutena versiona.

Arkisto on osoitteessa github.com/Sophon-LLC/voice-agent-benchmark-landscape; viittausmuoto ja versioluettelo ovat tietuesivulla.

Kaikki kirjoitukset