Blog

Jak powstał krajobraz benchmarków dla agentów głosowych i dlaczego nie jest to ranking

Trzynaście publicznych benchmarków, każdy w jednym wierszu, z zakresem możliwości i licencjami ze źródeł własnych. Na co odpowiada zbiór danych, a na co nie.

Opublikowano

„Voice agent evaluation” obejmuje kilka różnych problemów, które łatwo ze sobą pomylić. Benchmark może testować rozpoznawanie mowy bez testowania wykonania zadania lub testować wywołania narzędzi bez interakcji głosowej na żywo. Voice Agent Benchmark Landscape powstał, aby te granice wyraźnie określić. Ten wpis jest o tym, jak go zbudowano.

Jeden wiersz na benchmark, jedno pytanie na pole

W wersji z 1 września 2026 r. zbiór danych ma 13 wierszy. Dla każdego benchmarku odnotowuje główny cel oraz, w osobnych polach, czy benchmark obejmuje dane wejściowe w postaci mowy, dane wyjściowe w postaci mowy, interakcję wieloturową, użycie narzędzi, realizację celu, działanie na komputerze lub w przeglądarce, materiały ze spotkań lub materiały długie oraz działanie w czasie rzeczywistym. Odnotowuje również, czy dane są publiczne, osobno licencję na kod i licencję na dane, adresy repozytorium, karty zbioru danych i publikacji, datę ostatniej weryfikacji oraz notatki z dowodami.

Każda wartość zdolności to jedno z czterech słów: yes, no, partial lub unclear. „Partial” oznacza, że zdolność pojawia się w części pakietu lub jest oceniana pośrednio; nie mówi nic o jakości. „No” oznacza, że zdolność jest poza opublikowanym zakresem lub nieobecna w publicznych materiałach, a nie, że projekt nigdy nie mógłby jej obsługiwać. „Unclear” jest używane, gdy publiczne materiały były niewystarczające do klasyfikacji, i pozostaje, dopóki nie wyjaśni tego źródło pochodzące od twórców.

Źródła są własne, a licencje zapisane podwójnie

Każdy wiersz cytuje repozytorium, kartę zbioru danych lub artykuł naukowy samych autorów; nic nie jest klasyfikowane na podstawie wtórnych opracowań. Audyt źródeł w repozytorium wymienia dla każdego wiersza strony, które potwierdziły wartości dotyczące zdolności, oraz strony, które określają licencje. Licencje na kod i dane są rejestrowane osobno, ponieważ różnią się częściej, niż się powszechnie sądzi: kod i dane jednego z wpisów są objęte licencją społecznościową, która nie jest licencją open-source i ogranicza użycie komercyjne; kod innego jest na licencji Apache-2.0, podczas gdy jego dane są na licencji CC BY-NC 4,0 i wymagają uzyskania dostępu. Czytelnik decydujący o ponownym wykorzystaniu benchmarku potrzebuje obu tych informacji.

Dlaczego nie ma wyników

Tablica wyników wymaga wspólnego zadania i wspólnej metryki. Te trzynaście projektów zostało zaprojektowanych do trzynastu różnych pytań ewaluacyjnych, więc pojedynczy ranking porównywałby rzeczy, które nie zostały stworzone do porównywania. Dlatego zestawienie rejestruje, co mierzy każdy benchmark, a nie to, jak jakikolwiek system sobie z nim radzi. Umieszczenie na liście nie oznacza poparcia, a zbiór danych nie zawiera prywatnego benchmarku produkcyjnego Cue na 227 próbek, opisanego w studium przypadku Google DeepMind.

Czego brakuje na mapie

W takim ujęciu publicznie dostępne benchmarki są najsilniejsze w obszarach konwersacyjnej obsługi klienta, wyboru narzędzi za pomocą mowy, oceny treści asystentów głosowych i rozpoznawania mowy. Są słabo reprezentowane na przecięciu ciągłego dyktowania głosowego na komputerze w dowolnych aplikacjach, transkrypcji długich spotkań ze strukturalnymi notatkami, działań na komputerze obejmujących wiele aplikacji, potwierdzania i odwracalności skutków ubocznych oraz w jakiejkolwiek pojedynczej ewaluacji, która łączy jakość transkrypcji z wynikami dla użytkownika. Repozytorium stwierdza to jako lukę w istniejących zasobach, a nie jako wadę któregokolwiek z projektów.

Zachowanie rzetelności

  • Plik danych ma udokumentowany schemat i walidator; wiersz, który narusza kontrakt pól, nie przechodzi weryfikacji.
  • Każdy link do źródła jest okresowo sprawdzany. Definitywny błąd 404 lub 410 powoduje niezaliczenie audytu; limity zapytań i błędy przejściowe są raportowane osobno, aby nie zostały błędnie oznaczone jako niedziałające linki.
  • Wydania są archiwizowane na Zenodo z numerem DOI dla każdej wersji, a rekord zawiera sumę kontrolną SHA-256 zbioru danych, więc cytat wskazuje na konkretny plik.
  • Poprawki określają wiersz, pole, proponowaną wartość i źródło od autora, i są publikowane jako nowa wersja.

Repozytorium znajduje się pod adresem github.com/Sophon-LLC/voice-agent-benchmark-landscape; format cytowania i lista wersji są na stronie rekordu.

Wszystkie wpisy