ElevenLabs 发布 Eleven v4 语音模型,提升表现力与一致性并推出 Turbo 版本
ElevenLabs 发布 Eleven v4 及实时语音版本 v4 Turbo,前者改进指令遵循和长篇语音一致性,后者在公司测试中约 150 毫秒开始输出可听语音。
ElevenLabs 发布 Eleven v4 及实时语音版本 v4 Turbo,前者改进指令遵循和长篇语音一致性,后者在公司测试中约 150 毫秒开始输出可听语音。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
GPT‑Live‑1 为 API 带来自然的全双工语音对话能力。它还提供更强的指令遵循能力、自定义声音和电话接入支持。
推荐理由:全双工对话之外,指令遵循、自定义声音与电话接入也是语音体验落地的关键维度,材料提供了这些能力的更新概览。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
NVIDIA Magpie TTS 以开放权重和自主部署支持低延迟多语言语音智能体构建,可通过 NVIDIA NIM 在自有基础设施运行。模型参数规模为 364M,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。本地 NIM 测试中,B200 单流首音频延迟为 32 ms。
Google 发布音频模型 Gemini 3.5 Live Translate,支持自动识别 70+ 种语言并进行近实时语音到语音翻译。模型持续生成译音,保留说话者的语调、节奏和音高,官方称整个会话中仅落后说话者几秒,所有生成音频均带有 SynthID 水印。
推荐理由:相较于等待说话结束再翻译的系统,连续生成译音的方式把上下文质量与跟随延迟的取舍带入实时跨语言沟通。
Google 发布文本转语音模型 Gemini 3.1 Flash TTS,新增音频标签,可通过文本中的自然语言指令精细控制声音风格、语速和表达方式。模型原生支持多说话人对话及超过 70 种语言,在 Artificial Analysis TTS 排行榜获得 1,211 Elo,所有生成音频均嵌入 SynthID 水印。
推荐理由:音频标签把语气、语速和句中表达变化纳入文本输入控制,为多角色对话与本地化语音应用提供了更细粒度的创作方式。
Mistral 发布文本转语音模型 Voxtral TTS,以 4B 参数支持 9 种语言的情感表达语音生成及零样本跨语言声音适配。官方称,在输入 10 秒声音样本和 500 个字符的典型条件下,模型延迟为 70ms;其人类评估显示,自然度优于 ElevenLabs Flash v2.5,音频质量与 ElevenLabs v3 相当。
推荐理由:原文将语音自然度的人类评估与具体输入条件下的延迟并列呈现,为企业权衡语音智能体的表达质量与响应速度提供了参考。
Mistral AI 发布 Voxtral Transcribe 2,包括批量转写模型 Voxtral Mini Transcribe V2 和实时模型 Voxtral Realtime,均支持 13 种语言。
推荐理由:批量版的错误率与定价、实时版的延迟与开放权重条件,为语音工作流在成本、响应速度和部署方式之间的取舍提供了具体参照。
Mistral AI 发布 Voxtral 语音理解模型,提供面向生产应用的 24B 和面向本地、端侧部署的 3B 版本,均采用 Apache 2.0 许可证。
推荐理由:将音频问答、摘要和函数调用纳入可开放部署的语音模型,为需要兼顾数据控制与语义理解的应用提供了选型参考。