Documentazione · Prove

Voice Agent Benchmark Landscape: documento e citazione

Cosa il dataset è e non è, dove è pubblicato, le sue versioni, la licenza e i DOI, e come citarlo. Gestito da Sophon LLC.

Pubblicato il · Aggiornato il

Il Voice Agent Benchmark Landscape è un insieme di dati che pubblichiamo: una mappa strutturata di benchmark pubblici per agenti vocali, assistenti vocali, uso di strumenti tramite comandi vocali, azioni su computer, riconoscimento vocale e comprensione di riunioni. Questa pagina ne costituisce il record di pubblicazione.

Cos’è

  • 13 benchmark, una riga per ciascuno, in un file leggibile meccanicamente (data/benchmarks.jsonl) con un contratto di campo documentato (data/schema.json).
  • Ogni riga registra l’obiettivo primario del benchmark; se copre input vocale, output vocale, interazione multi-turno, uso di strumenti, completamento di obiettivi, azioni su computer o browser, materiale di riunioni o di lunga durata e funzionamento in tempo reale; se i dati sono pubblici; le licenze del codice e dei dati, registrate separatamente; gli indirizzi del repository, della scheda del dataset e del paper; la data dell’ultima verifica; e le note di prova.
  • I valori sono sì, no, parziale o non chiaro. Parziale significa che la capacità compare in una parte della suite o è valutata indirettamente; non descrive la qualità.
  • Ogni riga ha almeno una fonte di prima parte, elencata nell’audit delle fonti. I fatti nella versione attuale sono stati verificati il 1º settembre 2026 dai repository pubblici, dalle schede dei dataset e dai paper dei manutentori.

Cosa non è

  • Non è una classifica. Non contiene punteggi e non classifica nulla. L’inclusione non implica un’approvazione. Il motivo per cui è stato costruito così si trova in Come è stato costruito il Voice Agent Benchmark Landscape.
  • Non è un framework di valutazione. Non c’è nulla da eseguire su un modello; il repository fornisce i dati, il loro schema, un validatore e uno strumento di interrogazione.
  • Non è il benchmark di Cue. Il benchmark di produzione privato da 227 campioni descritto nel caso di studio di Google DeepMind non ne fa parte.

Dove è pubblicato

DoveIndirizzoRuolo
GitHubSophon-LLC/voice-agent-benchmark-landscapeFonte ufficiale: dati, schema, audit delle fonti, regole di contribuzione, test
Zenododoi.org/10.5281/zenodo.22227265Versioni archiviate con DOI; il DOI concettuale rimanda sempre alla versione più recente.
Hugging Facechatjesus/voice-agent-benchmark-landscapeCopia speculare del dataset.

Versioni

VersioneDataRecordLicenzaDOI della versione
v1.0.21 settembre 202613MIT10.5281/zenodo.22227266

Il record Zenodo per la v1.0.2 contiene l’hash SHA-256 del dataset (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4), così una copia scaricata può essere verificata rispetto a quella archiviata.

Come citare

Il file CITATION.cff del repository indica Sophon LLC come autore. Cita il DOI della versione quando è importante la riproducibilità esatta e il DOI concettuale per il progetto in evoluzione:

Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266

Correzioni

Una correzione deve indicare la riga, il campo, il valore proposto e una fonte di prima parte, seguendo il file CONTRIBUTING.md del repository. Le modifiche vengono rilasciate come una nuova versione con un nuovo DOI.

C’è un errore in questa pagina? feedback@sophoninc.com