„Voice agent evaluation“ pokrývá několik různých problémů, které lze snadno zaměnit. Benchmark může testovat rozpoznávání řeči, aniž by testoval dokončení úkolu, nebo testovat volání nástrojů bez živé mluvené interakce. Voice Agent Benchmark Landscape existuje proto, aby tyto hranice explicitně vymezil. Tento příspěvek je o tom, jak byl vytvořen.
Jeden řádek na benchmark, jedna otázka na pole
Datová sada má ve vydání z 1. září 2026 13 řádků. Pro každý benchmark zaznamenává primární zaměření a v samostatných polích, zda benchmark pokrývá mluvený vstup, mluvený výstup, vícekrokovou interakci, použití nástrojů, dokončení cíle, akci na počítači nebo v prohlížeči, schůzky nebo dlouhé materiály a provoz v reálném čase. Zaznamenává také, zda jsou data veřejná, zvlášť licenci na kód a licenci na data, adresy repozitáře, karty datové sady a článku, datum posledního ověření a poznámky k důkazům.
Každá hodnota schopnosti je jedním ze čtyř slov: yes, no, partial nebo unclear. „Partial“ znamená, že se schopnost objevuje v části sady nebo je hodnocena nepřímo; nic to nevypovídá o kvalitě. „No“ znamená, že schopnost je mimo publikovaný rozsah nebo chybí ve veřejných materiálech, ne že by ji projekt nikdy nemohl podporovat. „Unclear“ se používá, když veřejný materiál nestačil ke klasifikaci, a zůstává, dokud to nerozhodne zdroj z první ruky.
Zdroje jsou primární a licence jsou zaznamenány dvakrát
Každý řádek cituje repozitář, kartu datové sady nebo článek samotných správců; nic není klasifikováno na základě sekundárního zdroje. Audit zdrojů v repozitáři uvádí pro každý řádek stránky, které podpořily hodnoty schopností, a stránky, které uvádějí licence. Licence pro kód a data se zaznamenávají samostatně, protože se liší častěji, než se lidé domnívají. Kód a data jedné položky podléhají komunitní licenci, která není open-source licencí a omezuje komerční využití; kód jiné položky je pod licencí Apache-2.0, zatímco její data jsou pod licencí CC BY-NC 4,0 a jsou neveřejná. Čtenář, který se rozhoduje, zda benchmark znovu použije, potřebuje oba tyto údaje.
Proč zde nejsou žádná skóre
Žebříček vyžaduje společný úkol a společnou metriku. Třináct projektů bylo navrženo pro třináct různých evaluačních otázek, takže jednotné hodnocení by srovnávalo věci, které nebyly vytvořeny ke srovnání. Přehled proto zaznamenává, co jednotlivé benchmarky měří, a nic o tom, jak si na nich jakýkoli systém vede. Zahrnutí neznamená podporu a datová sada neobsahuje soukromý produkční benchmark Cue s 227 vzorky, který je popsán v případové studii společnosti Google DeepMind.
Co mapa ukazuje, že chybí
Takto uspořádaný veřejný přehled je nejsilnější v oblasti konverzačního zákaznického servisu, hlasového výběru nástrojů, hodnocení obsahu hlasových agentů a rozpoznávání řeči. Je slabý v průniku oblastí, jako je nepřetržité hlasové psaní na počítači v libovolných aplikacích, přepis dlouhých schůzek se strukturovanými poznámkami, ovládání počítače napříč aplikacemi, potvrzování a vratnost vedlejších účinků a jakékoli jednotlivé hodnocení, které spojuje kvalitu přepisu s výsledky pro uživatele. Repozitář to uvádí jako mezeru v tom, co existuje, nikoli jako nedostatek jakéhokoli projektu.
Udržování poctivosti
- Datový soubor má zdokumentované schéma a validátor; řádek, který porušuje kontrakt pole, neprojde kontrolou.
- Každý odkaz na zdroj se pravidelně znovu kontroluje. Definitivní chyba 404 nebo 410 znamená neúspěch auditu; limity rychlosti a dočasné chyby se hlásí samostatně, aby nebyly mylně označeny jako nefunkční odkazy.
- Vydání jsou archivována na Zenodo s DOI pro každou verzi a záznam obsahuje SHA-256 datové sady, takže citace odkazuje na přesný soubor.
- Opravy uvádějí řádek, pole, navrhovanou hodnotu a primární zdroj a jsou vydávány jako nová verze.
Repozitář se nachází na adrese github.com/Sophon-LLC/voice-agent-benchmark-landscape; formát citací a seznam verzí jsou na stránce záznamu.