“Voice agent evaluation” kontzeptuak erraz nahas daitezkeen hainbat arazo biltzen ditu. Benchmark batek hizketaren ezagutza proba dezake, baina ez ataza baten burutzea; edo tresnen deiak proba ditzake, baina ez zuzeneko ahozko elkarrekintza batekin. Voice Agent Benchmark Landscape muga horiek esplizitu egiteko sortu zen. Post hau nola eraiki zen azaltzeko da.
Errenkada bat benchmark bakoitzeko, galdera bat eremu bakoitzeko
Datu-multzoak 13 errenkada ditu 2026ko irailaren 1eko bertsioan. Benchmark bakoitzeko, foku nagusia erregistratzen du, eta, eremu bereizietan, benchmarkak ahozko sarrera, ahozko irteera, txanda anitzeko interakzioa, tresnen erabilera, helburuak betetzea, ordenagailuko edo nabigatzaileko ekintzak, bilerak edo material luzea eta denbora errealeko funtzionamendua estaltzen dituen. Halaber, datuak publikoak diren, kodearen lizentzia eta datuen lizentzia bereizita, biltegiaren, datu-multzoaren txartelaren eta artikuluaren helbideak, egiaztatu zen azken data eta froga-oharrak erregistratzen ditu.
Gaitasun-balio bakoitza lau hitzetako bat da: yes, no, partial edo unclear. “Partial” hitzak esan nahi du gaitasuna suite baten zati batean agertzen dela edo zeharka ebaluatzen dela; ez du kalitateari buruz ezer esaten. “No” hitzak esan nahi du gaitasuna argitaratutako esparrutik kanpo dagoela edo material publikoetan ez dagoela, ez proiektuak inoiz ezingo lukeela onartu. “Unclear” erabiltzen da material publikoa sailkatzeko nahikoa ez zenean, eta hala geratzen da lehen eskuko iturri batek argitu arte.
Iturriak jatorrizkoak dira, eta lizentziak bi aldiz erregistratzen dira
Lerro bakoitzak mantentzaileen biltegia, datu-multzoaren txartela edo artikulua aipatzen du; ez da ezer sailkatzen bigarren mailako idazki batetik. Biltegiko iturburuen auditoretzak zerrendatzen ditu, lerroka, gaitasun-balioak babesten dituzten orriak eta lizentziak adierazten dituztenak. Kodearen eta datuen lizentziak bereizita erregistratzen dira, jendeak uste duena baino maizago desberdinak direlako: sarrera bateko kodea eta datuak kode irekiko lizentzia ez den eta erabilera komertziala mugatzen duen komunitate-lizentzia baten pean daude; beste bateko kodea Apache-2.0 da, eta datuak, berriz, CC BY-NC 4,0 eta atezaindunak. Benchmark bat berrerabiltzea erabakitzen ari den irakurle batek bi datuak behar ditu.
Zergatik ez dagoen puntuaziorik
Sailkapen-taula batek ataza partekatu bat eta metrika partekatu bat behar ditu. Hamahiru proiektuak hamahiru ebaluazio-galdera desberdinetarako diseinatu ziren; beraz, sailkapen bakar batek konparatzeko eraiki ez ziren gauzak konparatuko lituzke. Horregatik, paisaiak benchmark bakoitzak zer neurtzen duen erregistratzen du, eta ezer ez edozein sistemak bertan nola funtzionatzen duenari buruz. Zerrendan egoteak ez du esan nahi babesten denik, eta datu-multzoak ez du barne hartzen Google DeepMind-en kasu-azterlanean deskribatutako Cue-ren 227 lagineko produkzio-benchmark pribatua.
Mapak zer falta den erakusten duena
Horrela aurkeztuta, paisaia publikoa sendoagoa da elkarrizketako bezeroarentzako arretan, ahozko tresnen hautaketan, ahots-laguntzaileen edukien ebaluazioan eta hizketaren ezagutzean. Ahulagoa da, ordea, honako hauen elkargunean: edozein aplikaziotan mahaigaineko etengabeko ahots bidezko idazketa, bilera luzeen transkripzioa ohar egituratuekin, aplikazioen arteko ekintza informatikoa, alboko ondorioen berrespena eta itzulgarritasuna, eta transkripzioaren kalitatea erabiltzailearen emaitzekin lotzen duen edozein ebaluazio bakarra. Biltegiak dio hori hutsune bat dela existitzen den horretan, ez edozein proiekturen akats bat.
Zintzotasunari eustea
- Datu-fitxategiak eskema dokumentatu bat eta balidatzaile bat ditu; eremu-kontratua hausten duen lerro batek ez du egiaztapena gainditzen.
- Iturburu-esteka guztiak berriro egiaztatzen dira programazio baten arabera. 404 edo 410 errore definitibo batek ez du auditoretza gainditzen; tasa-mugak eta aldi baterako erroreak bereizita jakinarazten dira, esteka hautsitzat oker etiketatu ez daitezen.
- Argitalpenak Zenodo-n artxibatzen dira bertsio bakoitzeko DOI batekin, eta erregistroak datu-multzoaren SHA-256 kodea darama; horrela, aipamen batek fitxategi zehatz bat adierazten du.
- Zuzenketek lerroa, eremua, proposatutako balioa eta lehen mailako iturri bat izendatzen dituzte, eta bertsio berri gisa argitaratzen dira.
Biltegia github.com/Sophon-LLC/voice-agent-benchmark-landscape helbidean dago; aipamen-formatua eta bertsio-zerrenda erregistro-orrian daude.