„Voice agent evaluation“ pokrýva niekoľko rôznych problémov, ktoré sa dajú ľahko zameniť. Benchmark môže testovať rozpoznávanie reči bez testovania dokončenia úlohy alebo testovať volania nástrojov bez živej hovorenej interakcie. Voice Agent Benchmark Landscape existuje, aby tieto hranice explicitne vymedzil. Tento príspevok je o tom, ako bol vytvorený.
Jeden riadok na benchmark, jedna otázka na pole
Súbor údajov má vo verzii z 1. septembra 2026 13 riadkov. Pre každý benchmark zaznamenáva primárne zameranie a ako samostatné polia, či benchmark pokrýva hovorený vstup, hovorený výstup, viacťahovú interakciu, používanie nástrojov, dokončenie cieľa, akcie v počítači alebo prehliadači, materiály zo schôdzí alebo dlhšieho formátu a prevádzku v reálnom čase. Zaznamenáva tiež, či sú údaje verejné, zvlášť licenciu na kód a licenciu na údaje, adresy repozitára, karty súboru údajov a vedeckého článku, dátum posledného overenia a poznámky k dôkazom.
Každá hodnota schopnosti je jedným zo štyroch slov: yes, no, partial alebo unclear. „Partial“ znamená, že schopnosť sa objavuje v časti súboru alebo je hodnotená nepriamo; nevypovedá to nič o kvalite. „No“ znamená, že schopnosť je mimo zverejneného rozsahu alebo chýba vo verejných materiáloch, nie že by ju projekt nikdy nemohol podporovať. „Unclear“ sa používa, keď verejný materiál nebol dostatočný na klasifikáciu, a zostáva tak, kým to nevyrieši zdroj z prvej ruky.
Zdroje sú primárne a licencie sú zaznamenané dvakrát
Každý riadok cituje vlastné úložisko, kartu súboru údajov alebo článok správcov. Nič nie je klasifikované zo sekundárneho zdroja. Audit zdrojov v úložisku uvádza pre každý riadok stránky, ktoré podporili hodnoty schopností, a stránky, ktoré uvádzajú licencie. Licencie na kód a údaje sa zaznamenávajú samostatne, pretože sa líšia častejšie, ako sa predpokladá. Kód a údaje jednej položky podliehajú komunitnej licencii, ktorá nie je licenciou open-source a obmedzuje komerčné použitie. Kód inej položky je pod licenciou Apache-2.0, zatiaľ čo jej údaje sú pod licenciou CC BY-NC 4,0 a sú prístupné na požiadanie. Čitateľ, ktorý sa rozhoduje, či opätovne použije benchmark, potrebuje oba fakty.
Prečo neuvádzame žiadne skóre
Rebríček najlepších si vyžaduje spoločnú úlohu a spoločnú metriku. Týchto trinásť projektov bolo navrhnutých pre trinásť rôznych hodnotiacich otázok, takže jednotné poradie by porovnávalo veci, ktoré neboli vytvorené na porovnávanie. Prehľad preto zaznamenáva, čo jednotlivé benchmarky merajú, a nič o tom, ako si na nich ktorýkoľvek systém vedie. Zahrnutie neznamená schválenie a súbor údajov neobsahuje súkromný produkčný benchmark spoločnosti Cue s 227 vzorkami, ktorý je opísaný v prípadovej štúdii Google DeepMind.
Čo na mape chýba
Takto usporiadaný verejný prehľad je najsilnejší v oblasti konverzačného zákazníckeho servisu, výberu nástrojov hlasom, hodnotenia obsahu hlasových asistentov a rozpoznávania reči. Je slabý v prieniku tém, ako sú nepretržité hlasové písanie na počítači v ľubovoľných aplikáciách, prepis dlhých stretnutí so štruktúrovanými poznámkami, vykonávanie akcií na počítači naprieč aplikáciami, potvrdzovanie a vratnosť vedľajších účinkov a akékoľvek jednotlivé hodnotenie, ktoré spája kvalitu prepisu s výsledkami pre používateľa. Úložisko to uvádza ako medzeru v existujúcich riešeniach, nie ako nedostatok ktoréhokoľvek projektu.
Ako zaisťujeme presnosť
- Dátový súbor má zdokumentovanú schému a validátor. Riadok, ktorý poruší štruktúru polí, neprejde kontrolou.
- Každý odkaz na zdroj sa pravidelne opätovne kontroluje. Definitívna chyba 404 alebo 410 znamená neúspech auditu. Obmedzenia rýchlosti a dočasné chyby sa hlásia samostatne, aby neboli nesprávne označené ako nefunkčné odkazy.
- Vydania sú archivované na Zenodo s DOI pre každú verziu a záznam obsahuje SHA-256 súboru údajov, takže citácia odkazuje na presný súbor.
- Opravy uvádzajú riadok, pole, navrhovanú hodnotu a primárny zdroj a sú vydané ako nová verzia.
Úložisko sa nachádza na github.com/Sophon-LLC/voice-agent-benchmark-landscape. Formát citácie a zoznam verzií sú na stránke záznamu.