如何在 SageMaker AI 上使用 vLLM-Omni 构建实时语音应用——第 1 部分
开发者可通过 AWS vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,实现无需等待完整响应生成的流式语音播放。教程使用持久双向连接发送文本并接收音频块,提供部署脚本和 Gradio 客户端示例。
开发者可通过 AWS vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,实现无需等待完整响应生成的流式语音播放。教程使用持久双向连接发送文本并接收音频块,提供部署脚本和 Gradio 客户端示例。
ElevenLabs 发布 Eleven v4 及实时语音版本 v4 Turbo,前者改进指令遵循和长篇语音一致性,后者在公司测试中约 150 毫秒开始输出可听语音。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署至全托管实时推理端点。模型仅需数秒参考音频及转录文本即可克隆声音,无需重新训练,支持跨语言克隆。部署方案使用预构建服务容器,生成 24 kHz 音频,并将音频数据保留在用户的 AWS 环境内。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
AWS WhisperX 深度学习容器可部署到 Amazon SageMaker AI 实时或异步端点,提供逐词时间戳和说话人标签,无需构建自定义镜像。实时端点适合须在 60 秒内完成处理的短音频,异步端点推荐用于长音频;AWS Samples 提供可运行的部署示例。
Meta 将 AI 助手装上钥匙扣,并表示 Muse 助手即将登陆其智能眼镜。周三公布的无摄像头 Ray-Bans 仅支持音频交互,公司还推出了可在佩戴眼镜进行视频通话时代表用户的逼真数字化身。隐私与安全仍是挑战:Meta 已修复一个可能让黑客控制他人 Muse 智能体的漏洞。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
Voice Arena 与 Hugging Face 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测,印地语成为榜单首个全球南方语言。评测集包含公开与私有划分,覆盖互不重叠的 4,888 名说话者,每人记录 12 项属性,以支持分析不同人群的识别差异。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
Google Research 推出研究原型 AgentHands,让 AI 智能体在 XR 中生成与语音同步、贴合用户物理环境的手势。系统将 LLM 回答中的手势事件绑定到触发词,通过词级时间戳协调语音与动画。研究以 12 名参与者对比纯语音基线,结果显示空间指代效果显著改善。
Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东地区的主权 AI,涵盖基础设施、模型开发和解决方案部署。双方计划开发和本地化先进模型,初期聚焦网络安全与语音,并开发阿拉伯语表现强劲的前沿模型。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。
Hugging Face 的研究对 11 个开源 ASR 模型开展三类测试,发现部分高分模型在音频与参考文本冲突时仍复现基准答案。在 LibriSpeech 上,部分基准表现较强的模型在约 30–40% 的样本中恢复了已被静音的数字,而若干模型在新采集音频上的这一现象减弱,提示基准相关声学线索可能影响转写。
推荐理由:通过参考错误复现、数字静音和拼写切换三类探针,研究提供了区分真实转写能力与针对公开基准优化的可迁移评估方法。
伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。