Open ASR Leaderboard 新增首个全球南方语言:印地语
Voice Arena 与 Hugging Face 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测,印地语成为榜单首个全球南方语言。评测集包含公开与私有划分,覆盖互不重叠的 4,888 名说话者,每人记录 12 项属性,以支持分析不同人群的识别差异。
Voice Arena 与 Hugging Face 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测,印地语成为榜单首个全球南方语言。评测集包含公开与私有划分,覆盖互不重叠的 4,888 名说话者,每人记录 12 项属性,以支持分析不同人群的识别差异。
Google Research 推出研究原型 AgentHands,让 AI 智能体在 XR 中生成与语音同步、贴合用户物理环境的手势。系统将 LLM 回答中的手势事件绑定到触发词,通过词级时间戳协调语音与动画。研究以 12 名参与者对比纯语音基线,结果显示空间指代效果显著改善。
Hugging Face 的研究对 11 个开源 ASR 模型开展三类测试,发现部分高分模型在音频与参考文本冲突时仍复现基准答案。在 LibriSpeech 上,部分基准表现较强的模型在约 30–40% 的样本中恢复了已被静音的数字,而若干模型在新采集音频上的这一现象减弱,提示基准相关声学线索可能影响转写。
推荐理由:通过参考错误复现、数字静音和拼写切换三类探针,研究提供了区分真实转写能力与针对公开基准优化的可迁移评估方法。
Hume 推出 Real World VoiceEQ 基准,评估超过 40 个闭源与开源语音模型在真实交互中的人类感知质量。基准基于超过 100 万次人类评分开发,覆盖 15+ 个评估维度和超过 60 项指标,涵盖语音识别、语音合成、语音到语音及语音理解。
推荐理由:将准确率、情绪理解与声音一致性分开评估,为语音系统选型提供了按场景比较的依据,而不是依赖单一总分。