Tài liệu · Bằng chứng

Bối cảnh Benchmark Tác nhân Giọng nói: bản ghi và trích dẫn

Bộ dữ liệu này là gì và không phải là gì, nó được xuất bản ở đâu, các phiên bản, giấy phép và DOI của nó, và cách trích dẫn. Được duy trì bởi Sophon LLC.

Công bố · Cập nhật

Voice Agent Benchmark Landscape là một bộ dữ liệu do chúng tôi xuất bản: một bản đồ có cấu trúc về các benchmark công khai cho tác nhân giọng nói, trợ lý nói, sử dụng công cụ qua giọng nói, hành động trên máy tính, nhận dạng giọng nói và hiểu cuộc họp. Trang này là hồ sơ xuất bản của nó.

Nó là gì

  • 13 benchmark, mỗi benchmark một hàng, trong một tệp máy có thể đọc được (data/benchmarks.jsonl) với một hợp đồng trường dữ liệu được ghi lại (data/schema.json).
  • Mỗi hàng ghi lại trọng tâm chính của benchmark; liệu nó có bao gồm đầu vào bằng giọng nói, đầu ra bằng giọng nói, tương tác nhiều lượt, sử dụng công cụ, hoàn thành mục tiêu, hành động trên máy tính hoặc trình duyệt, tài liệu dạng dài hoặc cuộc họp, và hoạt động thời gian thực; liệu dữ liệu có công khai hay không; giấy phép mã nguồn và dữ liệu, được ghi riêng; địa chỉ kho lưu trữ, thẻ bộ dữ liệu và bài báo; ngày xác minh lần cuối; và ghi chú bằng chứng.
  • Các giá trị là có, không, một phần hoặc không rõ. Một phần có nghĩa là khả năng đó xuất hiện trong một phần của bộ hoặc được đánh giá gián tiếp; nó không mô tả chất lượng.
  • Mỗi hàng có ít nhất một nguồn của bên thứ nhất, được liệt kê trong bản kiểm tra nguồn. Các dữ kiện trong bản phát hành hiện tại đã được xác minh vào ngày 1 tháng 9 năm 2026 từ các kho lưu trữ công khai, thẻ bộ dữ liệu và bài báo của người duy trì.

Đây không phải là gì

  • Không phải là bảng xếp hạng. Nó không chứa điểm số và không xếp hạng bất cứ thứ gì. Việc đưa vào không ngụ ý sự chứng thực. Lý do nó được xây dựng theo cách đó có trong Cách toàn cảnh benchmark tác nhân giọng nói được xây dựng.
  • Không phải là một khung đánh giá. Không có gì để chạy trên một mô hình; kho lưu trữ cung cấp dữ liệu, lược đồ của nó, một trình xác thực và một công cụ truy vấn.
  • Không phải là benchmark của Cue. Benchmark sản xuất riêng tư gồm 227 mẫu được mô tả trong nghiên cứu tình huống của Google DeepMind không phải là một phần của nó.

Nơi xuất bản

Nơi tảiĐịa chỉVai trò
GitHubSophon-LLC/voice-agent-benchmark-landscapeNguồn hồ sơ: dữ liệu, lược đồ, kiểm tra nguồn, quy tắc đóng góp, kiểm thử
Zenododoi.org/10.5281/zenodo.22227265Các bản phát hành đã lưu trữ có DOI; DOI khái niệm luôn trỏ đến phiên bản mới nhất
Hugging Facechatjesus/voice-agent-benchmark-landscapeBản sao của bộ dữ liệu

Các phiên bản

Phiên bảnNgàyBản ghiGiấy phépDOI phiên bản
v1.0.21 tháng 9 năm 202613MIT10.5281/zenodo.22227266

Bản ghi Zenodo cho v1.0.2 chứa SHA-256 của bộ dữ liệu (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4) để bạn có thể kiểm tra một bản sao đã tải xuống so với bản đã lưu trữ.

Cách trích dẫn

Tệp CITATION.cff của kho mã nguồn ghi tác giả là Sophon LLC. Hãy trích dẫn DOI phiên bản khi cần khả năng tái lập chính xác và trích dẫn DOI khái niệm cho dự án đang phát triển:

Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266

Các đính chính

Một bản sửa lỗi cần nêu rõ hàng, trường, giá trị đề xuất và một nguồn của bên thứ nhất, theo tệp CONTRIBUTING.md của kho mã nguồn. Các thay đổi được phát hành dưới dạng một phiên bản mới với một DOI mới.

Có gì đó sai trên trang này? feedback@sophoninc.com