Google DeepMind·· 2026-04-16精选AI 评分73
Google 发布 Gemini 3.1 Flash TTS,以音频标签增强语音表达控制
Gemini 3.1 Flash TTS: the next generation of expressive AI speech
AI 导读
Google 发布文本转语音模型 Gemini 3.1 Flash TTS,新增音频标签,可通过文本中的自然语言指令精细控制声音风格、语速和表达方式。模型原生支持多说话人对话及超过 70 种语言,在 Artificial Analysis TTS 排行榜获得 1,211 Elo,所有生成音频均嵌入 SynthID 水印。
推荐理由
音频标签把语气、语速和句中表达变化纳入文本输入控制,为多角色对话与本地化语音应用提供了更细粒度的创作方式。
来源:Google DeepMind · deepmind.google