Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为实时对话加入动态虚拟形象
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。