Il Voice Agent Benchmark Landscape è un insieme di dati che pubblichiamo: una mappa strutturata di benchmark pubblici per agenti vocali, assistenti vocali, uso di strumenti tramite comandi vocali, azioni su computer, riconoscimento vocale e comprensione di riunioni. Questa pagina ne costituisce il record di pubblicazione.
Cos’è
- 13 benchmark, una riga per ciascuno, in un file leggibile meccanicamente (data/benchmarks.jsonl) con un contratto di campo documentato (data/schema.json).
- Ogni riga registra l’obiettivo primario del benchmark; se copre input vocale, output vocale, interazione multi-turno, uso di strumenti, completamento di obiettivi, azioni su computer o browser, materiale di riunioni o di lunga durata e funzionamento in tempo reale; se i dati sono pubblici; le licenze del codice e dei dati, registrate separatamente; gli indirizzi del repository, della scheda del dataset e del paper; la data dell’ultima verifica; e le note di prova.
- I valori sono sì, no, parziale o non chiaro. Parziale significa che la capacità compare in una parte della suite o è valutata indirettamente; non descrive la qualità.
- Ogni riga ha almeno una fonte di prima parte, elencata nell’audit delle fonti. I fatti nella versione attuale sono stati verificati il 1º settembre 2026 dai repository pubblici, dalle schede dei dataset e dai paper dei manutentori.
Cosa non è
- Non è una classifica. Non contiene punteggi e non classifica nulla. L’inclusione non implica un’approvazione. Il motivo per cui è stato costruito così si trova in Come è stato costruito il Voice Agent Benchmark Landscape.
- Non è un framework di valutazione. Non c’è nulla da eseguire su un modello; il repository fornisce i dati, il loro schema, un validatore e uno strumento di interrogazione.
- Non è il benchmark di Cue. Il benchmark di produzione privato da 227 campioni descritto nel caso di studio di Google DeepMind non ne fa parte.
Dove è pubblicato
| Dove | Indirizzo | Ruolo |
|---|---|---|
| GitHub | Sophon-LLC/voice-agent-benchmark-landscape | Fonte ufficiale: dati, schema, audit delle fonti, regole di contribuzione, test |
| Zenodo | doi.org/10.5281/zenodo.22227265 | Versioni archiviate con DOI; il DOI concettuale rimanda sempre alla versione più recente. |
| Hugging Face | chatjesus/voice-agent-benchmark-landscape | Copia speculare del dataset. |
Versioni
| Versione | Data | Record | Licenza | DOI della versione |
|---|---|---|---|---|
| v1.0.2 | 1 settembre 2026 | 13 | MIT | 10.5281/zenodo.22227266 |
Il record Zenodo per la v1.0.2 contiene l’hash SHA-256 del dataset (1d36c7b3f73565147fb7afff076c611c5fddc331e3ec47dc867625b75b70bbf4), così una copia scaricata può essere verificata rispetto a quella archiviata.
Come citare
Il file CITATION.cff del repository indica Sophon LLC come autore. Cita il DOI della versione quando è importante la riproducibilità esatta e il DOI concettuale per il progetto in evoluzione:
Sophon LLC. Voice Agent Benchmark Landscape, version 1.0.2. 1 September 2026. https://doi.org/10.5281/zenodo.22227266
Correzioni
Una correzione deve indicare la riga, il campo, il valore proposto e una fonte di prima parte, seguendo il file CONTRIBUTING.md del repository. Le modifiche vengono rilasciate come una nuova versione con un nuovo DOI.