Blogu

Si u ndërtua peizazhi i benchmark-ut të agjentëve zanorë dhe pse nuk është një tabelë klasifikimi

Trembëdhjetë benchmark-e publike, secili në një rresht, me mbulimin e aftësive dhe licencat nga burime të dorës së parë. Çfarë përgjigje jep grupi i të dhënave dhe çfarë refuzon të japë.

Publikuar më

“Voice agent evaluation” mbulon disa probleme të ndryshme që ngatërrohen lehtë. Një benchmark mund të testojë njohjen e të folurit pa testuar përfundimin e detyrës, ose të testojë thirrjet e mjeteve pa një ndërveprim të folur të drejtpërdrejtë. Voice Agent Benchmark Landscape ekziston për t'i bërë të qartë këta kufij. Ky postim flet për mënyrën se si u ndërtua.

Një rresht për benchmark, një pyetje për fushë

Grupi i të dhënave ka 13 rreshta në versionin e 1 shtatorit 2026. Për çdo benchmark ai regjistron fokusin kryesor dhe, si fusha të veçanta, nëse benchmark-u mbulon hyrjen e folur, daljen e folur, ndërveprimin me shumë kthesa, përdorimin e veglave, përfundimin e qëllimit, veprimin në kompjuter ose shfletues, materialin e takimeve ose të gjatë, dhe funksionimin në kohë reale. Ai gjithashtu regjistron nëse të dhënat janë publike, licencën e kodit dhe licencën e të dhënave veçmas, adresat e depozitorit, kartës së grupit të të dhënave dhe punimit, datën e verifikimit të fundit dhe shënimet e provave.

Çdo vlerë aftësie është një nga katër fjalët: yes, no, partial ose unclear. “Partial” do të thotë që aftësia shfaqet në një pjesë të një pakete ose vlerësohet në mënyrë indirekte; nuk thotë asgjë për cilësinë. “No” do të thotë që aftësia është jashtë fushëveprimit të publikuar ose mungon në materialet publike, jo se projekti nuk mund ta mbështeste kurrë atë. “Unclear” përdoret kur materiali publik ishte i pamjaftueshëm për t'u klasifikuar dhe mbetet i tillë derisa një burim i dorës së parë ta zgjidhë atë.

Burimet janë të dorës së parë dhe licencat regjistrohen dy herë

Çdo rresht citon depon, kartën e setit të të dhënave ose punimin e vetë mirëmbajtësve; asgjë nuk klasifikohet nga një përshkrim dytësor. Auditimi i burimeve në depo liston, për çdo rresht, faqet që mbështetën vlerat e aftësive dhe faqet që përcaktojnë licencat. Licencat e kodit dhe të të dhënave regjistrohen veçmas, sepse ndryshojnë më shpesh nga sa mendojnë njerëzit: kodi dhe të dhënat e njërit artikull janë nën një licencë komunitare që nuk është licencë me kod të hapur dhe kufizon përdorimin tregtar; kodi i një tjetri është Apache-2.0, ndërsa të dhënat e tij janë CC BY-NC 4,0 dhe me hyrje të kufizuar. Një lexues që vendos nëse do të ripërdorë një benchmark ka nevojë për të dyja faktet.

Pse nuk ka rezultate

Një tabelë renditjeje kërkon një detyrë të përbashkët dhe një metrikë të përbashkët. Të trembëdhjetë projektet u hartuan për trembëdhjetë pyetje të ndryshme vlerësimi, kështu që një renditje e vetme do të krahasonte gjëra që nuk ishin ndërtuar për t'u krahasuar. Prandaj, panorama regjistron se çfarë mat çdo benchmark dhe asgjë rreth performancës së ndonjë sistemi në të. Përfshirja nuk nënkupton miratim dhe seti i të dhënave nuk përmban benchmark-un privat të prodhimit me 227 mostra të Cue, të përshkruar në studimin e rastit të Google DeepMind.

Çfarë tregon harta se mungon

E paraqitur në këtë mënyrë, panorama publike është më e fortë në shërbimin bisedor ndaj klientit, përzgjedhjen e mjeteve me zë, vlerësimin e përmbajtjes së agjentëve zanorë dhe njohjen e të folurit. Ajo është e dobët në kryqëzimin e shtypjes së vazhdueshme zanore në desktop në aplikacione arbitrare, transkriptimin e mbledhjeve të gjata me shënime të strukturuara, veprimin kompjuterik ndër-aplikacional, konfirmimin dhe kthyeshmërinë e efekteve anësore, dhe çdo vlerësim të vetëm që lidh cilësinë e transkriptimit me rezultatet e përdoruesit. Depoja e thekson këtë si një boshllëk në atë që ekziston, jo si një defekt në ndonjë projekt.

Duke e mbajtur të ndershme

  • Skedari i të dhënave ka një skemë të dokumentuar dhe një vërtetues; një rresht që thyen kontratën e fushës dështon në kontroll.
  • Çdo lidhje burimi rikontrollohet sipas një orari. Një 404 ose 410 përfundimtar dështon në auditim; kufijtë e normës dhe gabimet kalimtare raportohen veçmas, në mënyrë që të mos etiketohen gabimisht si lidhje të prishura.
  • Publikimet arkivohen në Zenodo me një DOI për çdo version, dhe regjistrimi mban SHA-256 të setit të të dhënave, kështu që një citim i referohet një skedari të saktë.
  • Korrigjimet emërtojnë rreshtin, fushën, vlerën e propozuar dhe një burim të dorës së parë, dhe publikohen si një version i ri.

Depoja gjendet në github.com/Sophon-LLC/voice-agent-benchmark-landscape; formati i citimit dhe lista e versioneve janë në faqen e regjistrimit.

Të gjitha postimet