“Voice agent evaluation” aptver vairākas dažādas problēmas, kuras ir viegli sajaukt. Benchmark var pārbaudīt runas atpazīšanu, nepārbaudot uzdevuma izpildi, vai pārbaudīt rīku izsaukumus bez tiešraides mutiskas mijiedarbības. Voice Agent Benchmark Landscape pastāv, lai šīs robežas padarītu skaidras. Šis ieraksts ir par to, kā tas tika izveidots.
Viens benchmark vienā rindā, viens jautājums katrā laukā
Datu kopas 2026. gada 1. septembra laidienā ir 13 rindu. Katram benchmark ir reģistrēts tā galvenais fokuss un atsevišķos laukos — vai benchmark aptver runas ievadi, runas izvadi, vairāku gājienu mijiedarbību, rīku lietošanu, mērķa sasniegšanu, darbības datorā vai pārlūkprogrammā, sapulču vai garas formas materiālus un reāllaika darbību. Tāpat ir reģistrēts, vai dati ir publiski, koda licence un datu licence atsevišķi, repozitorija, datu kopas kartes un raksta adreses, pēdējās pārbaudes datums un pierādījumu piezīmes.
Katra spējas vērtība ir viens no četriem vārdiem: yes, no, partial vai unclear. “Partial” nozīmē, ka spēja parādās daļā no komplekta vai tiek vērtēta netieši; tas neko nesaka par kvalitāti. “No” nozīmē, ka spēja ir ārpus publicētā tvēruma vai nav publiskajos materiālos, nevis to, ka projekts to nekad nevarētu atbalstīt. “Unclear” tiek lietots, ja ar publiskajiem materiāliem nepietika, lai to klasificētu, un tas paliek, līdz to atrisina pirmavots.
Avoti ir pirmavoti, un licences tiek reģistrētas divreiz
Katrā rindā ir atsauce uz uzturētāju repozitoriju, datu kopas karti vai rakstu; nekas nav klasificēts no sekundāra apraksta. Avotu audits repozitorijā katrai rindai uzskaita lapas, kas pamatoja spēju vērtības, un lapas, kurās norādītas licences. Koda un datu licences tiek reģistrētas atsevišķi, jo tās atšķiras biežāk, nekā cilvēki pieņem: viena ieraksta kods un dati ir saskaņā ar kopienas licenci, kas nav atvērtā koda licence un ierobežo komerciālu izmantošanu; cita ieraksta kods ir Apache-2.0, bet tā dati ir CC BY-NC 4,0 un ar ierobežotu piekļuvi. Lasītājam, kurš izlemj, vai atkārtoti izmantot kādu benchmark, ir nepieciešami abi fakti.
Kāpēc nav rezultātu
Līderu sarakstam ir nepieciešams kopīgs uzdevums un kopīga metrika. Šie trīspadsmit projekti tika izstrādāti trīspadsmit dažādiem novērtēšanas jautājumiem, tāpēc vienots rangs salīdzinātu lietas, kas nav radītas salīdzināšanai. Tāpēc ainava reģistrē to, ko katrs benchmark mēra, un neko par to, kā kāda sistēma tajā darbojas. Iekļaušana nenozīmē apstiprinājumu, un datu kopa nesatur Cue privāto 227 paraugu ražošanas benchmark, kas aprakstīts Google DeepMind gadījuma izpētē.
Ko karte parāda kā trūkstošu
Šādi izkārtota, publiskā ainava ir visspēcīgākā sarunvalodas klientu apkalpošanā, runas rīku atlasē, balss aģenta satura novērtēšanā un runas atpazīšanā. Tā ir vāja nepārtrauktas balss rakstīšanas krustpunktā patvaļīgās lietojumprogrammās, garas formas sapulču transkripcijā ar strukturētām piezīmēm, starplietojumprogrammu datora darbībā, blakusefektu apstiprināšanā un atgriezeniskumā, un jebkurā atsevišķā novērtējumā, kas saista transkripcijas kvalitāti ar lietotāja rezultātiem. Repozitorijs to norāda kā plaisu esošajā, nevis kā defektu kādā projektā.
Godīguma uzturēšana
- Datu failam ir dokumentēta shēma un validators; rinda, kas pārkāpj lauka līgumu, neiztur pārbaudi.
- Katra avota saite tiek regulāri pārbaudīta. Galīga 404 vai 410 kļūda neiztur auditu; ātruma ierobežojumi un pārejošas kļūdas tiek ziņotas atsevišķi, lai tās netiktu nepareizi apzīmētas kā bojātas saites.
- Izlaidumi tiek arhivēti Zenodo ar DOI katrai versijai, un ieraksts satur datu kopas SHA-256, tāpēc atsauce norāda uz precīzu failu.
- Labojumos tiek norādīta rinda, lauks, ierosinātā vērtība un primārais avots, un tie tiek piegādāti kā jauna versija.
Repozitorijs atrodas github.com/Sophon-LLC/voice-agent-benchmark-landscape; citēšanas formāts un versiju saraksts ir ieraksta lapā.