Blog

Bagaimana lanskap benchmark agen suara dibangun, dan mengapa ini bukan papan peringkat

Tiga belas benchmark publik, masing-masing satu baris, dengan cakupan kemampuan dan lisensi dari sumber pihak pertama. Apa yang dijawab oleh set data dan apa yang ditolaknya.

Diterbitkan

“Voice agent evaluation” mencakup beberapa masalah berbeda yang mudah tercampur aduk. Sebuah benchmark mungkin menguji pengenalan ucapan tanpa menguji penyelesaian tugas, atau menguji pemanggilan alat tanpa interaksi lisan langsung. Voice Agent Benchmark Landscape ada untuk memperjelas batasan-batasan tersebut. Tulisan ini membahas cara pembuatannya.

Satu baris per benchmark, satu pertanyaan per bidang

Set data ini memiliki 13 baris dalam rilis 1 September 2026. Untuk setiap benchmark, set data ini mencatat fokus utama dan, sebagai bidang terpisah, apakah benchmark tersebut mencakup input lisan, output lisan, interaksi multi-giliran, penggunaan alat, penyelesaian tujuan, tindakan komputer atau peramban, materi rapat atau materi bentuk panjang, dan operasi waktu nyata. Set data ini juga mencatat apakah datanya bersifat publik, lisensi kode dan lisensi data secara terpisah, alamat repositori, kartu set data dan makalah, tanggal terakhir diverifikasi, dan catatan bukti.

Setiap nilai kapabilitas adalah salah satu dari empat kata: yes, no, partial, atau unclear. “Partial” berarti kapabilitas tersebut muncul di sebagian rangkaian produk atau dievaluasi secara tidak langsung; ini tidak menyatakan apa pun tentang kualitas. “No” berarti kapabilitas tersebut berada di luar lingkup yang dipublikasikan atau tidak ada dalam materi publik, bukan berarti proyek tersebut tidak akan pernah dapat mendukungnya. “Unclear” digunakan ketika materi publik tidak cukup untuk melakukan klasifikasi, dan akan tetap demikian hingga ada sumber pihak pertama yang memastikannya.

Sumber berasal dari pihak pertama, dan lisensi dicatat dua kali

Setiap baris mengutip repositori, kartu set data, atau makalah milik pengelola sendiri; tidak ada yang diklasifikasikan dari tulisan sekunder. Audit sumber di repositori mencantumkan, per baris, halaman yang mendukung nilai kapabilitas dan halaman yang menyatakan lisensi. Lisensi kode dan data dicatat secara terpisah karena keduanya lebih sering berbeda dari yang orang kira: kode dan data salah satu entri berada di bawah lisensi komunitas yang bukan lisensi sumber terbuka dan membatasi penggunaan komersial; kode entri lain adalah Apache-2.0 sementara datanya adalah CC BY-NC 4,0 dan dibatasi aksesnya. Pembaca yang memutuskan apakah akan menggunakan kembali suatu benchmark memerlukan kedua fakta tersebut.

Mengapa tidak ada skor

Papan peringkat memerlukan tugas bersama dan metrik bersama. Ketiga belas proyek ini dirancang untuk tiga belas pertanyaan evaluasi yang berbeda, sehingga satu peringkat tunggal akan membandingkan hal-hal yang tidak dibuat untuk dibandingkan. Oleh karena itu, lanskap ini mencatat apa yang diukur oleh setiap benchmark dan tidak mencatat apa pun tentang bagaimana kinerja sistem mana pun padanya. Penyertaan tidak menyiratkan dukungan, dan set data ini tidak berisi benchmark produksi 227 sampel privat milik Cue yang dijelaskan dalam studi kasus Google DeepMind.

Apa yang ditunjukkan peta ini tidak ada

Jika ditata seperti ini, lanskap publik paling kuat dalam layanan pelanggan percakapan, pemilihan alat yang diucapkan, evaluasi konten asisten suara, dan pengenalan ucapan. Lanskap ini tipis pada persimpangan pengetikan suara desktop berkelanjutan dalam aplikasi arbitrer, transkripsi rapat bentuk panjang dengan catatan terstruktur, tindakan komputer lintas aplikasi, konfirmasi dan reversibilitas efek samping, dan evaluasi tunggal apa pun yang menghubungkan kualitas transkripsi dengan hasil pengguna. Repositori menyatakan hal ini sebagai celah dalam apa yang ada, bukan sebagai cacat dalam proyek mana pun.

Menjaganya tetap jujur

  • File data memiliki skema yang terdokumentasi dan validator; baris yang melanggar kontrak bidang akan gagal dalam pemeriksaan.
  • Setiap tautan sumber diperiksa ulang secara berkala. Kesalahan 404 atau 410 yang definitif akan menggagalkan audit; batas laju dan kesalahan sementara dilaporkan secara terpisah sehingga tidak salah diberi label sebagai tautan rusak.
  • Rilis diarsipkan di Zenodo dengan DOI per versi, dan catatan tersebut memuat SHA-256 set data, sehingga kutipan menunjuk ke file yang tepat.
  • Koreksi menyebutkan baris, bidang, nilai yang diusulkan, dan sumber pihak pertama, dan dikirimkan sebagai versi baru.

Repositori ada di github.com/Sophon-LLC/voice-agent-benchmark-landscape; format kutipan dan daftar versi ada di halaman catatan.

Semua postingan