在 SageMaker AI 上使用 WhisperX 实现带说话人标签的转录
AWS WhisperX 深度学习容器可部署到 Amazon SageMaker AI 实时或异步端点,提供逐词时间戳和说话人标签,无需构建自定义镜像。实时端点适合须在 60 秒内完成处理的短音频,异步端点推荐用于长音频;AWS Samples 提供可运行的部署示例。
AWS WhisperX 深度学习容器可部署到 Amazon SageMaker AI 实时或异步端点,提供逐词时间戳和说话人标签,无需构建自定义镜像。实时端点适合须在 60 秒内完成处理的短音频,异步端点推荐用于长音频;AWS Samples 提供可运行的部署示例。
LFM2.5-VL-DSpark 通过推测解码加速 LFM2.5-VL-3B,端侧解码最高提速 3.13x,且不改变输出质量。草稿模型增加约 280M 参数,增幅为 8.9%,端侧端到端最高提速 2.62x。模型已开放权重,支持 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放超过 2,800 种病毒的蛋白复合物三维结构预测数据,支持未来大流行防范研究。
推荐理由:将病毒蛋白复合物预测结构按置信度开放共享,为研究者提出可实验检验的假设提供起点,也降低了资源有限团队获取结构数据的门槛。
Remedy Entertainment 的《CONTROL Resonant》首发登陆 GeForce NOW,Ultimate 会员可享 GeForce RTX 5080 级云端性能。9 月 27 日前购买 12 个月 Ultimate 会员可免费获得该游戏。GeForce NOW 也将很快支持 Googlebooks。
GitHub Copilot 应用重构拉取请求视图,让庞大的代码差异与审查讨论仍能流畅渲染。团队以包含 2,200 个文件、超过百万行变更和超过 400 条行内审查评论的开源拉取请求进行测试。方案保留代码行虚拟化,将固定代码高度与动态评论高度分开计算,通过延迟测量及锚定修正减少滚动跳动。
Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。
Google 公布 Private AI Compute 架构更新方案,将引入私密的服务端持久记忆,以支持跨设备延续上下文并保持端侧隐私标准。方案把数据存入加密的用户专属数据库,解密密钥仅由个人设备持有,处理请求时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密并将新增上下文加密保存。
OpenAI Academy 迎来两周年,并将 AI 技能带给更多社区。此次周年纪念聚焦 AI 技能向更多社区的推广。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
NVIDIA 验证工程师 Sakeena Fiza 在量产前测试系统并排查故障,帮助硬件在规模化部署中可靠运行。她与团队从系统首次上电开始,跨硬件、固件、软件及机械设计定位问题,在真实使用条件下将硬件推至极限,力求在客户遇到故障前发现隐患。
OpenAI 正将 Daybreak 项目的访问范围扩大至乌克兰政府,以支持民用基础设施的网络防御。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类对 AI 的控制以及国际合作。讲话聚焦这些议题,未提供具体措施或技术细节。
Harvey 借助 GPT-6 Astra,将法律上下文转化为结构更清晰、更贴合上下文的法律文书。生成的文稿让律师能够腾出精力,专注于策略工作。
invideo 借助 GPT‑6 Astra 更精准地规划剪辑,将色彩校正和调色效果提升至原来的 3 倍。它还可在一天内制作 50 个自定义效果。
Ringg 借助 OpenAI 的 AI 智能体解决高达 65% 的客户来电问题。其使用 GPT-5.6,为语音、聊天、WhatsApp 和网页渠道提供多语言智能体,成本较 GPT-4.1 降低 90%。
MentalHealthBench 是一项融入专家意见的评测基准,用于评估 AI 在贴近真实情境的心理健康对话中的回应。评估重点是回应是否有帮助且安全。
NVIDIA 与合作伙伴在新加坡 AI Day 展示东南亚 AI 进展,涵盖公共部门规模化部署及区域语言模型开发。AI Singapore 正将 Nemotron 开放模型和 NeMo 工具纳入 SEA-LION 模型家族。Viettel AI 针对越南语和智能体应用微调 Nemotron 3 Super,在 VMLU 评测中排名最高。
ChatGPT Ads 正扩展至东南亚和台湾,为符合条件的企业提供新的触达渠道。这项扩展让符合条件的企业能够覆盖超过 60 个国家的人群。
Airbnb 正在扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,让更多工程团队能够使用这些模型。这些模型用于帮助工程团队修复缺陷、设计系统,并加快交付速度。
OpenAI 与 Grab 推出区域项目 GO Forward with AI,帮助东南亚 30,000 名合作伙伴培养实用 AI 技能。项目面向该地区的合作伙伴,聚焦实用 AI 技能培养。
GPT-6 改进了提示词缓存,通过更高的缓存命中率、新增诊断功能、显式断点及控制选项,降低延迟与成本。这些改进涵盖缓存命中、诊断与控制,原文未提供具体性能数据或成本降幅。
OpenAI 推出 GPT-6 Sol 和 Luna 两款模型,将前沿智能用于日常工作。两款模型在能力与成本之间提供不同的平衡。
NVIDIA 在 ROSCon 发布免费开源的 Isaac ROS 5.0,新增智能体开发工作流,并支持 ROS Lyrical 和 Ubuntu 24.04。
Parallel 借助 GPT‑6 Astra,让其 AI 智能体研究并综合劳动力市场数据的耗时与成本均降至此前模型的一半。对比结果针对劳动力市场数据的研究与综合任务。
oMLX 创建者兼维护者 Jun Kim 加入 Hugging Face,将继续领导项目并为 MLX 社区贡献力量。oMLX 将从业余项目转为获得资金支持、持续维护的项目,保持 Apache 2.0 许可证,团队希望借此提高稳定性并加快开发。Hugging Face 的一项具体重点是简化 transformers 模型定义到参考 MLX 实现的转换,让不同引擎复用这些实现并专注于各自的特色功能。
OpenAI 阐明前沿模型及其防护措施的第三方 AI 安全评估优先事项与原则。评估强调严谨性、安全性和独立性。
Hugging Face 为 Transformers 新增高效运行 GGUF 量化模型的支持,通过复用 ggml 内核并优化 generate,初期面向 Apple Silicon 本地推理。
英国 AI 安全研究所(AISI)正使用 EvalEval 基础设施公开评测结果,以支持更可复现、可验证的评测。公开数据通过 Evaluation Cards 提供,包含已核验结果、背景及配置信息,覆盖主实验的 5 项基准和 6 款前沿模型,便于研究者比较不同评测设置下的表现。
NVIDIA 推出 DSX Ready 资格认证计划,验证合作伙伴产品是否符合适用的 NVIDIA DSX AI 工厂参考设计要求。首批覆盖电池储能系统(BESS)和冷却分配单元(CDU),后续将扩展至更多基础设施及软件类别。认证帮助建设方评估产品、降低集成风险,但不替代现场工程评估。
NVIDIA 将物理 AI 的规模化部署安全落实到硬件、软件、AI 行为及运行环境,并以 Halos 提供全栈支持。动态环境、模型更新及复杂场景要求安全验证贯穿设计、部署与验证,而非仅在部署前检查。Halos 覆盖自动驾驶与机器人,结合仿真、真实世界验证和可重复检查,为第三方系统级认证做准备。
埃及 AI 生态正迈向规模化生产应用,NVIDIA 支持的本地企业已在语音、医疗、机器人等领域开展开发。NVIDIA Deep Learning Institute 在埃及的学员规模一年内增至十倍以上。Cassava 与 Vodafone Egypt 近日宣布 AI 工厂计划,通过 GPU 即服务提供本地基础设施,让数据留在境内。
Microsoft Research 的 RetroChimera 通过集成互补模型改进小分子逆合成预测,盲测中其单步反应预测更受专家化学家青睐。模型结合 R-SMILES 2 与 NeuralLoc,在 10 个高难度目标中有 9 个的完整合成路线获专家认可。相关研究已发表于 Nature,实现代码与权重已开源。
NVIDIA 将 AI 安全视为覆盖模型、智能体编排框架和运行环境的工程问题,要求每次部署具备可强制执行的边界、明确责任人及防护有效性的证据。运行环境应独立于智能体推理限制文件、网络和进程访问,为智能体配置可追溯身份与任务范围内的凭据,并对重大操作和权限变更保留人工审批。
Higgsfield AI 借助 GPT-6 Astra 在一天内推出新视频功能,加快创意工具面市。GPT-6 Astra 还让小企业更容易制作视频广告。
OpenAI 正与独立的数学及人工智能咨询小组合作,为新兴 AI 成果的审查与沟通提供指导。该小组的指导范围涵盖成果审查及相关信息的对外传达。
NVIDIA 在纽约气候周展示 5 家企业利用其 AI 技术推进清洁能源项目,涵盖电网优化、核电运营、储能及聚变研究。南加州爱迪生公司使用 ThinkLabs 软件,将每份并网申请的评估时间从 30-45 天缩短至 2 分钟。Redwood Materials 利用回收电动汽车电池及 NVIDIA Blackwell 平台,为 AI 工厂提供离网供电方案。
OpenAI 概述了构建全球共享 AI 标准的路径,呼吁协调评估、报告与治理工作,以提升 AI 安全性。其重点是推动这些领域的协同,建立共同遵循的标准。
OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的学习路径。这些学习路径旨在帮助学习者培养并展示实用 AI 技能。
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。V7 使用 GPT-5.6 将分散的公司文件转化为 AI 智能体可用的上下文,支持其完成关联来源的复杂工作。
Hugging Face 实测 tokenizers v1 候选版,在 Apple M4 Max 上覆盖的 10 个模型家族中,单线程编码比 v0.23 快 3 至 30 倍,保持相同 token ID 输出。