“Voice agent evaluation” birbiriyle karıştırılması kolay birkaç farklı sorunu kapsar. Bir benchmark, görev tamamlamayı test etmeden konuşma tanımayı veya canlı sözlü etkileşim olmadan araç çağrılarını test edebilir. Voice Agent Benchmark Landscape, bu sınırları belirginleştirmek için mevcuttur. Bu yazı, onun nasıl oluşturulduğu hakkındadır.
Benchmark başına bir satır, alan başına bir soru
Veri setinin 1 Eylül 2026 sürümünde 13 satır bulunmaktadır. Her benchmark için birincil odağı ve ayrı alanlar olarak benchmark’ın sözlü girdiyi, sözlü çıktıyı, çok turlu etkileşimi, araç kullanımını, hedef tamamlamayı, bilgisayar veya tarayıcı eylemini, toplantı veya uzun biçimli materyali ve gerçek zamanlı çalışmayı kapsayıp kapsamadığını kaydeder. Ayrıca verilerin halka açık olup olmadığını, kod lisansını ve veri lisansını ayrı ayrı, depo, veri seti kartı ve makale adreslerini, son doğrulama tarihini ve kanıt notlarını da kaydeder.
Her yetenek değeri şu dört kelimeden biridir: yes, no, partial veya unclear. “Partial”, yeteneğin bir paketin bir kısmında göründüğü veya dolaylı olarak değerlendirildiği anlamına gelir; kalite hakkında bir şey söylemez. “No”, yeteneğin yayımlanan kapsamın dışında olduğu veya herkese açık materyallerde bulunmadığı anlamına gelir, projenin onu asla destekleyemeyeceği anlamına gelmez. “Unclear”, herkese açık materyal sınıflandırma için yetersiz olduğunda kullanılır ve birinci taraf bir kaynak konuyu açıklığa kavuşturana kadar öyle kalır.
Kaynaklar birinci taraftır ve lisanslar iki kez kaydedilir
Her satır, bakımını yapanların kendi deposuna, veri kümesi kartına veya makalesine atıfta bulunur; hiçbir şey ikincil bir yazıdan sınıflandırılmaz. Depodaki kaynak denetimi, her satır için yetenek değerlerini destekleyen sayfaları ve lisansları belirten sayfaları listeler. Kod ve veri lisansları ayrı ayrı kaydedilir çünkü sanıldığından daha sık farklılık gösterirler: bir girdinin kodu ve verileri, açık kaynak lisansı olmayan ve ticari kullanımı kısıtlayan bir topluluk lisansı altındadır; bir diğerinin kodu Apache-2.0 iken verileri CC BY-NC 4,0 ve erişimi kısıtlıdır. Bir benchmark’ı yeniden kullanmaya karar veren bir okuyucunun her iki bilgiye de ihtiyacı vardır.
Neden skor yok
Bir liderlik tablosu için ortak bir görev ve ortak bir metrik gerekir. On üç proje, on üç farklı değerlendirme sorusu için tasarlanmıştır, bu nedenle tek bir sıralama, karşılaştırılmak üzere oluşturulmamış şeyleri karşılaştırırdı. Bu nedenle panorama, her bir benchmark’ın neyi ölçtüğünü kaydeder ve herhangi bir sistemin o benchmark’ta nasıl performans gösterdiğine dair hiçbir şey içermez. Dahil edilmesi bir onayı ima etmez ve veri kümesi, Google DeepMind’ın vaka çalışmasında açıklanan Cue’nun özel 227 örnekli üretim benchmark’ını içermez.
Haritanın neyin eksik olduğunu göstermesi
Bu şekilde düzenlendiğinde, halka açık benchmark panoraması en çok konuşmaya dayalı müşteri hizmetleri, sesli araç seçimi, sesli asistan içerik değerlendirmesi ve konuşma tanıma alanlarında güçlüdür. Rastgele uygulamalarda sürekli masaüstü sesli yazma, yapılandırılmış notlarla uzun biçimli toplantı transkripsiyonu, uygulamalar arası bilgisayar eylemi, yan etkilerin onayı ve geri alınabilirliği ve transkripsiyon kalitesini kullanıcı sonuçlarına bağlayan herhangi bir tek değerlendirmenin kesişiminde ise zayıftır. Depo, bunu mevcut olanlardaki bir boşluk olarak belirtir, herhangi bir projedeki bir kusur olarak değil.
Dürüstlüğü korumak
- Veri dosyasının belgelenmiş bir şeması ve bir doğrulayıcısı vardır; alan sözleşmesini bozan bir satır denetimde başarısız olur.
- Her kaynak bağlantısı belirli aralıklarla yeniden kontrol edilir. Kesin bir 404 veya 410 hatası denetimde başarısız olur; hız sınırları ve geçici hatalar, bozuk bağlantı olarak yanlış etiketlenmemeleri için ayrı olarak raporlanır.
- Sürümler, sürüm başına bir DOI ile Zenodo’da arşivlenir ve kayıt, veri kümesinin SHA-256’sını taşır, böylece bir alıntı tam bir dosyaya işaret eder.
- Düzeltmeler satırı, alanı, önerilen değeri ve birinci taraf bir kaynağı belirtir ve yeni bir sürüm olarak yayımlanır.
Depo github.com/Sophon-LLC/voice-agent-benchmark-landscape adresindedir; alıntı biçimi ve sürüm listesi kayıt sayfasındadır.