Lanskap Benchmark Agen Suara adalah set data yang kami publikasikan: sebuah peta terstruktur dari benchmark publik untuk agen suara, asisten lisan, penggunaan alat yang diaktifkan ucapan, tindakan komputer, pengenalan ucapan, dan pemahaman rapat. Halaman ini adalah catatan publikasinya.
Apa itu
- 13 benchmark, masing-masing satu baris, dalam sebuah berkas yang dapat dibaca mesin (data/benchmarks.jsonl) dengan kontrak bidang yang terdokumentasi (data/schema.json).
- Setiap baris mencatat fokus utama benchmark; apakah benchmark tersebut mencakup masukan lisan, keluaran lisan, interaksi multi-giliran, penggunaan alat, penyelesaian tujuan, tindakan komputer atau peramban, materi rapat atau bentuk panjang, dan operasi waktu nyata; apakah datanya publik; lisensi kode dan data, yang dicatat secara terpisah; alamat repositori, kartu set data, dan makalah; tanggal terakhir diverifikasi; dan catatan bukti.
- Nilainya adalah ya, tidak, sebagian, atau tidak jelas. Sebagian berarti kapabilitas tersebut muncul di sebagian rangkaian atau dievaluasi secara tidak langsung; ini tidak menggambarkan kualitas.
- Setiap baris memiliki setidaknya satu sumber pihak pertama, yang tercantum dalam audit sumber. Fakta-fakta dalam rilis saat ini diverifikasi pada 1 September 2026 dari repositori publik, kartu set data, dan makalah para pemelihara.
Yang bukan bagian darinya
- Bukan papan peringkat. Ini tidak berisi skor dan tidak memeringkatkan apa pun. Penyertaan tidak menyiratkan dukungan. Alasan mengapa ini dibuat seperti itu ada di Bagaimana lanskap benchmark agen suara dibuat.
- Bukan kerangka kerja evaluasi. Tidak ada yang bisa dijalankan terhadap sebuah model; repositori ini menyediakan data, skemanya, sebuah validator, dan sebuah alat kueri.
- Bukan benchmark Cue. Benchmark produksi pribadi dengan 227 sampel yang dijelaskan dalam studi kasus Google DeepMind bukan bagian darinya.
Tempat publikasinya
| Lokasi | Alamat | Peran |
|---|---|---|
| GitHub | Sophon-LLC/voice-agent-benchmark-landscape | Sumber catatan: data, skema, audit sumber, aturan kontribusi, pengujian |
| Zenodo | doi.org/10.5281/zenodo.22227265 | Rilis yang diarsipkan dengan DOI; DOI konsep selalu mengarah ke versi terbaru |
| Hugging Face | chatjesus/voice-agent-benchmark-landscape | Cerminan dari set data |
Versi
| Versi | Tanggal | Rekaman | Lisensi | DOI Versi |
|---|---|---|---|---|
| v1.0.2 | 1 September 2026 | 13 | MIT | 10.5281/zenodo.22227266 |
Catatan Zenodo untuk v1.0.2 memuat SHA-256 set data (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4) sehingga salinan yang diunduh dapat diperiksa terhadap salinan yang diarsipkan.
Cara mengutip
CITATION.cff repositori ini menyebutkan Sophon LLC sebagai penulisnya. Kutip DOI versi jika reproduktifitas yang sama persis penting dan kutip DOI konsep untuk proyek yang terus berkembang:
Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266
Koreksi
Koreksi menyebutkan baris, bidang, nilai yang diusulkan, dan sumber pihak pertama, mengikuti CONTRIBUTING.md repositori. Perubahan dirilis sebagai versi baru dengan DOI baru.