← 返回总览

VoiceBench low

online-leaderboardgeneralaudiospeechvoice-assistantaudiotext

2024 · https://matthewcym.github.io/VoiceBench/ · freshness: fresh 活跃的 leaderboard;端到端语音助手评测的标准参考。

专家判语 Expert verdict low

人工署名(chenhao)。值得回答: 对一个语音 MoA, VoiceBench 的口语 safety 维度是否比它的知识分更重要? 我认为是伪命题 - 这里很多合成语音、根本不是真实口语环境。 "部分合成语音"相对真实音频基准该打多少折? 我认为影响很大,打1折吧,或者直接不用了。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

VoiceBench(Chen、Yue et al.,NUS,2024;TACL)是给语音助手(voice assistant,你用嘴说话、它用语音回应的 AI)出的一套标准考卷(benchmark,给 AI 出的标准考卷),据称是第一套从多个角度考查这类助手的。它的来路有点特别:我们是在别人的技术报告里发现它的,比如 Qwen3-Omni 这类全模态模型的报告,会拿它来测音频能力。

这份考卷有 6,783 条口语指令(spoken instruction,用说话的方式下达的命令),一部分是机器合成的语音,一部分是真人录的,一共覆盖 8 类任务。它考三方面:通用知识(general knowledge)、听懂并照做指令(instruction-following)、安全合规(safety compliance,会不会照着危险要求乱答)。它还故意往里掺真实说话场景里的干扰,比如说话人口音、混响等环境噪声、内容本身的复杂度。这样一来,考的就不只是“能不能把话听写成文字”(也就是 ASR,语音转文字),而是“它当个语音助手到底好不好用”。

要注意的地方:有一部分语音是机器合成的(TTS,文字转语音),不一定能反映真实用户讲话的样子;而且它面向的是通用场景。拿来用的话,它适合充当 MoA(把多个模型组队、各管一块来用)里的口语交互这一块,顺带也能做个口语安全检查。

① 权威 Authority
学术/机构/引用

维护方 maintainersYiming Chen / Xianghu Yue et al. (NUS — Haizhou Li group)
机构数 institutions0
更新节奏 cadenceirregular
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 voice-assistantspoken-instruction-followingspeech-robustnessspoken-safety

模态 audiotext   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览