ElevenLabs 发布 Eleven v4 语音模型,提升表现力与一致性并推出 Turbo 版本
ElevenLabs 发布 Eleven v4 及实时语音版本 v4 Turbo,前者改进指令遵循和长篇语音一致性,后者在公司测试中约 150 毫秒开始输出可听语音。
ElevenLabs 发布 Eleven v4 及实时语音版本 v4 Turbo,前者改进指令遵循和长篇语音一致性,后者在公司测试中约 150 毫秒开始输出可听语音。
OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。
GPT 6.1 Sol 的标题信息称,其智能水平接近 Astra,价格仅为后者的五分之一。所提供正文仅含 Simon Willison 的发布信息、标签与订阅推广,未提供性能评测或具体定价依据。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务中以约五分之一成本接近 Astra,相关基准均为官方初步结果。
推荐理由:同价位模型的缓存价格与多步任务成本对照,为高频复用上下文的智能体工作流提供了比单看榜单分数更具体的选型依据。
NVIDIA 发布开放表格基础模型 Kumo Tabular,利用带标签行作为上下文,单次前向传播即可完成分类或回归,无需针对任务训练、调参或特征工程。
推荐理由:相较每个任务重新训练的表格建模流程,上下文学习把带标签样本直接用于预测,为减少特征工程与调参提供了具体路径。
OpenAI 发布 GPT-6.1 Sol,称其在编码、计算机使用和专业工作方面具备接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:原文将接近 Astra 的智能水平与其五分之一的标准 API 输入输出 token 价格并列,为比较能力与成本提供了参照。
Anthropic 发布 Claude Sonnet 5.5,定价与 Sonnet 5 相同,并称运行速度提升 30%+、多数任务成本最多降低 30%;该模型现已用于 claude.ai 免费层。
推荐理由:实测对比了不同思考强度下的生成结果与成本,展示了更高的思考预算不一定能换来可用输出这一具体问题。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
LFM2.5-VL-DSpark 通过推测解码加速 LFM2.5-VL-3B,端侧解码最高提速 3.13x,且不改变输出质量。草稿模型增加约 280M 参数,增幅为 8.9%,端侧端到端最高提速 2.62x。模型已开放权重,支持 llama.cpp、MLX-VLM 和 SGLang。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
AINews 因写作表现改善转用 Claude Opus 5.5;Anthropic 称其默认设置下每项任务较 Opus 5 便宜约 40%,OpenAI 同期发布的 GPT-6 Sol 和 Luna 则较各自 GPT-5.6 前代降价约 50%。
推荐理由:材料区分了标价下降与实际任务成本,并对照不同推理强度下的 token 消耗,为理解模型降价提供了更具体的比较口径。
OpenAI 推出 GPT-6 Sol 和 Luna 两款模型,将前沿智能用于日常工作。两款模型在能力与成本之间提供不同的平衡。
小米发布原生全模态 MiMo-V2.6-Pro 和 Flash,其中 Pro 以 46 分登顶 Artificial Analysis Intelligence Index 开放权重模型榜。
推荐理由:模型权重之外,公开的强化学习环境与训练配方提供了更具体的技术参照,有助于理解后训练投入与能力提升之间的关系。
Microsoft Research 的 RetroChimera 通过集成互补模型改进小分子逆合成预测,盲测中其单步反应预测更受专家化学家青睐。模型结合 R-SMILES 2 与 NeuralLoc,在 10 个高难度目标中有 9 个的完整合成路线获专家认可。相关研究已发表于 Nature,实现代码与权重已开源。
TypeSafe 发布 Jev,以 RLCD 训练面向决策、分类、路由和评分的模型,而非自由文本生成模型。正文转述其速度提升 20–200x、成本降低 40–400x 且输出 token 免费的宣称,并介绍了并行采样与校准能力。Jev 需要预定义输出格式,不能生成自由文本,定位是结构化选择的推理引擎,而非通用 LLM 替代品。
NVIDIA CEO 黄仁勋在 Dreamforce 表示,AI 作为基础设施将让人们“知晓一切、做到任何事”,并强调创新速度与安全可以兼顾。同期公布的 Salesforce 首款 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 构建,已在内部运行,计划于 10 月进入客户试点。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
GPT‑Live‑1 为 API 带来自然的全双工语音对话能力。它还提供更强的指令遵循能力、自定义声音和电话接入支持。
推荐理由:全双工对话之外,指令遵循、自定义声音与电话接入也是语音体验落地的关键维度,材料提供了这些能力的更新概览。
OpenAI 介绍 GPT-6 Astra,称其为旗下能力最强的商用模型。该模型具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,接入实时卫星观测,每小时生成新预报,温度和湿度等关键地表变量分辨率达到 5-kilometer。
推荐理由:与前代相比,实时卫星观测和逐小时更新缩短了预报的信息滞后,更细的空间分辨率有助于理解局地天气变化与能源规划需求。
NeoMME 推出 260M 和 800M 多语言多模态编码器,以单一双向 Transformer 处理文本和图像,全部检查点按 Apache 2.0 许可开放。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。
GigaPath-Flash 与 GigaTIME-Flash 通过知识蒸馏降低病理分析计算需求,支持更大患者队列的研究。GigaPath-Flash 在切片分类基准上与原模型得分差距不超过 3%,计算量约为其五十分之一。两款模型均以 Apache 2.0 许可开放,仅供研究,未经临床用途验证。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。
推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。
Google Research 构建了连续血糖监测基础模型 GlucoFM,以双流设计区分缓慢血糖趋势与短期波动,支持有限标注数据下的临床预测。在相同数据预训练的对比中,其在14项队列—任务评估中的平均 PR-AUC 为58.8,较最强 CGM 专用基线高4.1点。餐后血糖预测的跨设备平均绝对误差也最低。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
Liquid AI 发布适配 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,实测 H100 上最高加速 3.18x,M4 Max 上最高加速 2.87x。
Microsoft Research 扩大 Skala 的软件支持范围,现已在 CP2K 中可用,并正集成至 Psi4、FHI-aims、ORCA 和 VASP。Skala-1.1 在 GMTKN55 上的加权平均误差为 2.8 kcal/mol。团队还推出持续更新的基准,追踪后续版本的计算性能。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
Google DeepMind 发布手语转文本模型 SL2T,为 Pixel 11 的 Gboard 和 Live Transcribe 提供 ASL 转英文输入功能。
推荐理由:将手语输入接入手机日常输入场景,让无障碍交互不再只依赖英文打字,同时通过仅上传身体坐标减少原始视频传输。
Microsoft Research 介绍胸部 X 光研究模型 CARE-X,结合报告生成、分类与定位辅助头及 DAPO 强化学习,在 ReXVQA 上达到 94% 总体准确率。
NVIDIA Magpie TTS 以开放权重和自主部署支持低延迟多语言语音智能体构建,可通过 NVIDIA NIM 在自有基础设施运行。模型参数规模为 364M,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。本地 NIM 测试中,B200 单流首音频延迟为 32 ms。
Meta 今天发布 Muse Glimmer,这是从 Muse 蒸馏而来的 30B 多模态模型,采用 Apache 2.0 许可证,面向本地智能体应用。模型支持图像、无音频视频理解及多模态工具调用,可选用基于 DFlash 的推测解码模块,以额外内存开销换取生成加速。
推荐理由:从量化部署到推测解码的具体示例,为评估本地多模态智能体的部署路径及速度与显存之间的取舍提供了工程参考。
Google DeepMind 的 WeatherNext 在气旋路径、强度和风场结构预测中达到 SOTA 精度,平均三天预报可达到以往模型两天预报的准确度。发表于 Nature 的研究基于 2023 至 2024 年历史气旋进行评测,模型可在单个 TPU 上用不到一分钟生成一次 15 天预报,今年每个气旋的集合预测已扩展至 1,000 种可能情景。
推荐理由:以相同预报精度比较提前量,比单看误差更容易理解模型进步的实际意义,也为评估气旋预报工具提供了具体参照。
Mistral AI 发布 3B 多模态安全分类器 Shieldstral,以 Apache 2.0 开放权重,支持推理时用自然语言指定审核策略,无需重新训练。
推荐理由:将审核策略从固定类别改为推理时输入的自然语言问题,为不同产品调整安全边界提供了无需重新训练的部署路径。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。
Google DeepMind 今日开始在 Google Flow Music 推出音乐生成模型 Lyria 3.5,提升音乐性、歌词与人声质量。该模型支持生成更丰富、复杂且自然的旋律结构,改善歌词对提示词的遵循和结构感知,并让人声更逼真、情感表达更细腻、发音更准确。用户还可以更轻松地控制生成作品的节奏与时长。
推荐理由:此次更新同时涉及歌曲生成质量与节奏、时长控制,为判断音乐生成模型能否更贴合具体创作要求提供了清晰的比较维度。
Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。
推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。
NVIDIA 发布手术机器人生成式仿真模型 Cosmos-H-Dreams,通过知识蒸馏和 FlashDreams,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 帧/秒的闭环交互。
推荐理由:从离线轨迹生成转向实时闭环交互的技术路径,为理解手术机器人仿真如何同时降低生成成本与应对长序列误差提供了具体参考。