“Voice agent evaluation” inahusu matatizo kadhaa tofauti ambayo ni rahisi kuchanganya. Benchmark inaweza kupima utambuzi wa usemi bila kupima ukamilishaji wa kazi, au kupima wito wa zana bila mwingiliano wa moja kwa moja wa usemi. Voice Agent Benchmark Landscape ipo ili kufanya mipaka hiyo iwe wazi. Chapisho hili linahusu jinsi ilivyoundwa.
Safu moja kwa kila benchmark, swali moja kwa kila sehemu
Seti ya data ina safu 13 katika toleo la 1 Septemba 2026. Kwa kila benchmark, inarekodi lengo kuu na, kama sehemu tofauti, iwapo benchmark inashughulikia ingizo la sauti, tokeo la sauti, mwingiliano wa zamu nyingi, matumizi ya zana, ukamilishaji wa lengo, kitendo cha kompyuta au kivinjari, nyenzo za mkutano au za muda mrefu, na utendaji wa wakati halisi. Pia inarekodi iwapo data ni ya umma, leseni ya msimbo na leseni ya data kando, anwani za hazina, kadi ya seti ya data na karatasi, tarehe ya mwisho ya uthibitisho, na maelezo ya ushahidi.
Kila thamani ya uwezo ni mojawapo ya maneno manne: yes, no, partial au unclear. “Partial” inamaanisha uwezo unaonekana katika sehemu ya mkusanyiko au unatathminiwa kwa njia isiyo ya moja kwa moja; haisemi chochote kuhusu ubora. “No” inamaanisha uwezo huo uko nje ya wigo uliochapishwa au haupo katika nyenzo za umma, si kwamba mradi hauwezi kuusaidia kamwe. “Unclear” hutumika wakati nyenzo za umma hazikutosha kuainisha, na hubaki hivyo hadi chanzo cha kwanza kitakapotoa ufafanuzi.
Vyanzo ni vya wahusika wa kwanza, na leseni zinarekodiwa mara mbili
Kila safu inanukuu hazina, kadi ya data, au chapisho la wasimamizi wenyewe. Hakuna kitu kilichoainishwa kutoka kwa maandishi ya upili. Ukaguzi wa vyanzo katika hazina unaorodhesha, kwa kila safu, kurasa zilizounga mkono thamani za uwezo na kurasa zinazoeleza leseni. Leseni za msimbo na data hurekodiwa kando kwa sababu hutofautiana mara nyingi kuliko watu wanavyodhani. Msimbo na data ya ingizo moja viko chini ya leseni ya jumuiya ambayo si leseni ya programu huria na inazuia matumizi ya kibiashara. Msimbo wa ingizo jingine ni Apache-2.0 huku data yake ikiwa CC BY-NC 4.0 na imefungwa. Msomaji anayeamua kutumia tena benchmark anahitaji ukweli wote miwili.
Kwa nini hakuna alama
Ubao wa wanaoongoza unahitaji kazi ya pamoja na kipimo cha pamoja. Miradi kumi na tatu iliundwa kwa maswali kumi na tatu tofauti ya tathmini, kwa hivyo orodha moja ya viwango ingelinganisha vitu ambavyo havikujengwa ili kulinganishwa. Kwa hivyo, mandhari hii hurekodi kile kila benchmark inapima na haisemi chochote kuhusu jinsi mfumo wowote unavyofanya kazi kwayo. Kujumuishwa hakumaanishi kuidhinishwa, na seti ya data haina benchmark ya uzalishaji ya faragha ya sampuli 227 ya Cue iliyoelezwa katika uchunguzi kifani wa Google DeepMind.
Kile ramani inaonyesha kinakosekana
Ikiwekwa hivi, mandhari ya umma ina nguvu zaidi katika huduma kwa wateja kwa mazungumzo, uteuzi wa zana kwa sauti, tathmini ya maudhui ya msaidizi wa sauti, na utambuzi wa usemi. Ni dhaifu katika makutano ya uandishi endelevu wa sauti kwenye eneo-kazi katika programu zozote, unukuzi wa mikutano mirefu na maelezo yaliyopangwa, utendaji wa kompyuta baina ya programu, uthibitisho na uwezo wa kutengua athari, na tathmini yoyote moja inayounganisha ubora wa unukuzi na matokeo ya mtumiaji. Hazina inasema hilo kama pengo katika kile kilichopo, si kama kasoro katika mradi wowote.
Kudumisha uaminifu
- Faili ya data ina schema iliyoandikwa na kidhibiti. Safu inayokiuka mkataba wa sehemu haifaulu ukaguzi.
- Kila kiungo cha chanzo hukaguliwa tena kwa ratiba. Hitilafu ya 404 au 410 ya kudumu haifaulu ukaguzi. Vikomo vya viwango na hitilafu za muda huripotiwa kando ili zisitajwe kimakosa kama viungo vilivyovunjika.
- Matoleo huhifadhiwa kwenye Zenodo na DOI kwa kila toleo, na rekodi hubeba SHA-256 ya seti ya data, ili nukuu ielekeze kwenye faili kamili.
- Marekebisho hutaja safu, sehemu, thamani inayopendekezwa na chanzo cha moja kwa moja, na husafirishwa kama toleo jipya.
Hazina iko kwenye github.com/Sophon-LLC/voice-agent-benchmark-landscape; muundo wa nukuu na orodha ya matoleo viko kwenye ukurasa wa rekodi.