跳到正文

#语音

今日 2 条
今天9月30日周三
9月26日周六
9月25日周五
9月24日周四
  1. Ars Technica · AI30

    Meta 将 AI 助手装上钥匙扣

    Meta 将 AI 助手装上钥匙扣,并表示 Muse 助手即将登陆其智能眼镜。周三公布的无摄像头 Ray-Bans 仅支持音频交互,公司还推出了可在佩戴眼镜进行视频通话时代表用户的逼真数字化身。隐私与安全仍是挑战:Meta 已修复一个可能让黑客控制他人 Muse 智能体的漏洞。

9月23日周三
9月16日周三
8月28日周五
8月27日周四
  1. Google DeepMind77

    Gemini 3.5 Transcribe 实现智能语音转写

    Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。

    推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。

8月26日周三
8月25日周二
  1. Mistral AI44

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东地区主权 AI

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东地区的主权 AI,涵盖基础设施、模型开发和解决方案部署。双方计划开发和本地化先进模型,初期聚焦网络安全与语音,并开发阿拉伯语表现强劲的前沿模型。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。

8月21日周五
  1. Hugging Face Blog73

    Hugging Face 研究量化语音识别基准优化:部分高分模型复现错误参考转写

    Hugging Face 的研究对 11 个开源 ASR 模型开展三类测试,发现部分高分模型在音频与参考文本冲突时仍复现基准答案。在 LibriSpeech 上,部分基准表现较强的模型在约 30–40% 的样本中恢复了已被静音的数字,而若干模型在新采集音频上的这一现象减弱,提示基准相关声学线索可能影响转写。

    推荐理由:通过参考错误复现、数字静音和拼写切换三类探针,研究提供了区分真实转写能力与针对公开基准优化的可迁移评估方法。

7月1日周三
  1. Berkeley AI Research33

    BAIR 2026 届博士毕业生风采展示

    伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。