“Voice agent evaluation” asanlıqla qarışdırıla bilən bir neçə fərqli problemi əhatə edir. Bir benchmark tapşırığın tamamlanmasını yoxlamadan nitq tanınmasını sınaqdan keçirə və ya canlı şifahi qarşılıqlı əlaqə olmadan alət çağırışlarını yoxlaya bilər. Voice Agent Benchmark Landscape bu sərhədləri aydınlaşdırmaq üçün mövcuddur. Bu məqalə onun necə yaradıldığı haqqındadır.
Hər benchmark üçün bir sətir, hər sahə üçün bir sual
Məlumat toplusunun 1 sentyabr 2026-cı il buraxılışında 13 sətir var. Hər bir benchmark üçün onun əsas fokusu və ayrı-ayrı sahələr olaraq, benchmarkın şifahi girişi, şifahi çıxışı, çoxnövbəli qarşılıqlı əlaqəni, alət istifadəsini, məqsədə çatmağı, kompüter və ya brauzer hərəkətini, iclas və ya uzun formalı materialı və real vaxt rejimində işləməyi əhatə edib-etməməsi qeyd olunur. O, həmçinin məlumatların ictimai olub-olmadığını, kod lisenziyasını və məlumat lisenziyasını ayrı-ayrılıqda, repozitoriya, məlumat toplusu kartı və məqalə ünvanlarını, son yoxlanılma tarixini və sübut qeydlərini qeyd edir.
Hər bir qabiliyyət dəyəri dörd sözdən biridir: yes, no, partial və ya unclear. “Partial” qabiliyyətin dəstin bir hissəsində göründüyünü və ya dolayı yolla qiymətləndirildiyini bildirir; bu, keyfiyyət haqqında heç nə demir. “No” qabiliyyətin dərc edilmiş əhatə dairəsindən kənarda olduğunu və ya ictimai materiallarda olmadığını bildirir, layihənin onu heç vaxt dəstəkləyə bilməyəcəyini deyil. “Unclear” ictimai material təsnifat üçün kifayət etmədikdə istifadə olunur və birinci tərəf mənbəyi bunu həll edənə qədər belə qalır.
Mənbələr birinci tərəfdəndir və lisenziyalar iki dəfə qeyd olunur
Hər sətir tərtibatçıların öz repozitoriyasına, verilənlər bazası kartına və ya məqaləsinə istinad edir; heç nə ikinci dərəcəli mənbədən təsnif edilməyib. Repozitoriyadakı mənbə auditi hər sətir üzrə imkan dəyərlərini dəstəkləyən səhifələri və lisenziyaları bildirən səhifələri sadalayır. Kod və verilənlər lisenziyaları ayrı-ayrılıqda qeyd olunur, çünki onlar insanların güman etdiyindən daha tez-tez fərqlənir: bir qeydin kodu və verilənləri açıq mənbə lisenziyası olmayan və kommersiya məqsədli istifadəni məhdudlaşdıran icma lisenziyası altındadır; digərinin kodu Apache-2.0, verilənləri isə CC BY-NC 4,0 və qapalıdır. Bir benchmark-ı təkrar istifadə edib-etməməyə qərar verən oxucuya hər iki fakt lazımdır.
Niyə heç bir bal yoxdur
Liderlər lövhəsi üçün ortaq tapşırıq və ortaq metrika lazımdır. On üç layihə on üç fərqli qiymətləndirmə sualı üçün hazırlanmışdır, buna görə də vahid sıralama müqayisə üçün yaradılmamış şeyləri müqayisə edərdi. Buna görə də landşaft hər bir benchmark-ın nəyi ölçdüyünü qeyd edir, lakin hər hansı bir sistemin onun üzərində necə performans göstərdiyi barədə heç nə demir. Daxil edilmə təsdiq mənasını vermir və verilənlər bazasında Google DeepMind-ın keys-stadisində təsvir edilən Cue-nun şəxsi 227 nümunəli istehsalat benchmark-ı yoxdur.
Xəritə nəyin əskik olduğunu göstərir
Bu şəkildə təqdim edildikdə, ictimai landşaft söhbətə əsaslanan müştəri xidməti, səsli alət seçimi, səsli agentin məzmununun qiymətləndirilməsi və nitqin tanınması sahələrində ən güclüdür. İstənilən tətbiqlərdə davamlı masaüstü səsli yazma, strukturlaşdırılmış qeydlərlə uzun formalı iclas transkripsiyası, tətbiqlərarası kompüter hərəkəti, əlavə təsirlərin təsdiqi və geri qaytarılması, habelə transkripsiya keyfiyyətini istifadəçi nəticələri ilə əlaqələndirən hər hansı tək qiymətləndirmənin kəsişməsində zəifdir. Repozitoriya bunu mövcud olanlardakı bir boşluq kimi qeyd edir, hər hansı bir layihədəki qüsur kimi deyil.
Dürüstlüyü qorumaq
- Verilənlər faylının sənədləşdirilmiş sxeması və validatoru var; sahə müqaviləsini pozan sətir yoxlamadan keçə bilmir.
- Hər bir mənbə keçidi cədvəl üzrə yenidən yoxlanılır. Qəti 404 və ya 410 auditi uğursuz edir; sürət limitləri və müvəqqəti xətalar ayrıca bildirilir ki, onlar qırıq keçidlər kimi yanlış etiketlənməsinlər.
- Buraxılışlar hər versiya üçün DOI ilə Zenodo-da arxivlənir və qeyd verilənlər bazasının SHA-256-sını daşıyır, beləliklə, istinad dəqiq bir fayla işarə edir.
- Düzəlişlər sətir, sahə, təklif olunan dəyər və birinci tərəf mənbəyini adlandırır və yeni versiya kimi yayımlanır.
Repozitoriya github.com/Sophon-LLC/voice-agent-benchmark-landscape ünvanındadır; istinad formatı və versiya siyahısı qeyd səhifəsindədir.