「Voice agent evaluation」涵蓋了幾個容易混淆的不同問題。一個基準測試可能會測試語音辨識,而不測試任務完成度,或是在沒有即時語音互動的情況下測試工具呼叫。Voice Agent Benchmark Landscape 的存在是為了讓這些界線更明確。這篇文章是關於它是如何建立的。
每個基準測試一行,每個欄位一個問題
在 2026 年 9 月 1 日的版本中,此資料集有 13 行。針對每個基準測試,它記錄了主要焦點,並以獨立欄位記錄該基準測試是否涵蓋口語輸入、口語輸出、多輪互動、工具使用、目標完成、電腦或瀏覽器操作、會議或長篇材料,以及即時操作。它也分別記錄了資料是否公開、程式碼授權與資料授權、儲存庫、資料集卡片與論文的位址、上次驗證日期,以及佐證註記。
每個能力值都是四個詞之一:yes、no、partial 或 unclear。「Partial」表示該能力出現在套件的一部分中,或是被間接評估;這與品質無關。「No」表示該能力超出公開的範圍,或在公開材料中不存在,並非指該專案永遠無法支援。「Unclear」用於公開材料不足以分類的情況,並會維持此狀態直到有第一方來源澄清為止。
來源為第一方,且授權條款分開記錄
每一行都引用維護者自己的儲存庫、資料集卡片或論文;沒有任何分類是根據二手文章。儲存庫中的來源稽核為每一行都列出了支持能力值的頁面,以及說明授權條款的頁面。程式碼和資料的授權條款是分開記錄的,因為它們的差異比人們想像的更常見:某個項目的程式碼和資料採用的是一種非開源且限制商業用途的社群授權;另一個項目的程式碼是 Apache-2.0,而其資料則是 CC BY-NC 4.0 且設有存取門檻。讀者在決定是否要重複使用某個基準測試時,需要這兩項事實。
為什麼沒有分數
排行榜需要共同的任務和共同的指標。這十三個專案是為了解決十三個不同的評估問題而設計的,因此單一排名會將不應相互比較的事物拿來比較。因此,此概覽記錄了每個基準測試測量什麼,而完全不提任何系統在上面的表現如何。收錄不代表背書,且此資料集不包含 Google DeepMind 案例研究中所述的 Cue 私有 227 樣本產品基準測試。
這張圖顯示了所欠缺的部分
如此呈現,公開的概覽在對話式客服、口語工具選擇、語音助理內容評估和語音辨識方面最為強健。但在任意應用程式中的連續桌面語音輸入、帶有結構化筆記的長篇會議逐字稿、跨應用程式的電腦操作、副作用的確認與可逆性,以及任何將逐字稿品質與使用者結果連結起來的單一評估等交集領域則較為薄弱。儲存庫將此陳述為現存的差距,而非任何專案的缺陷。
保持其誠實性
- 資料檔案有文件化的綱要和驗證器;違反欄位合約的資料行將無法通過檢查。
- 每個來源連結都會定期重新檢查。明確的 404 或 410 錯誤會導致稽核失敗;速率限制和暫時性錯誤會分開報告,以免被誤標為失效連結。
- 發布版本會以每個版本一個 DOI 的方式存檔在 Zenodo 上,且記錄中帶有資料集的 SHA-256,因此引用會指向一個確切的檔案。
- 更正時會指明資料行、欄位、建議值和第一方來源,並以新版本發布。
儲存庫位於 github.com/Sophon-LLC/voice-agent-benchmark-landscape;引用格式和版本列表在記錄頁面上。