Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
ElevenLabs 发布 Eleven v4 及实时语音版本 v4 Turbo,前者改进指令遵循和长篇语音一致性,后者在公司测试中约 150 毫秒开始输出可听语音。
OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。
OpenAI 在 DevDay 2026 推出 GPT-6.1 Sol、常驻智能体 Dots 及多项平台更新,称 Sol 以 Astra 的 1/5 价格提供接近其水平的智能。
推荐理由:将模型价格、常驻智能体和订阅额度调整放在一起比较,有助于区分单次调用降价与整体使用成本变化对工作流的不同影响。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
GPT 6.1 Sol 的标题信息称,其智能水平接近 Astra,价格仅为后者的五分之一。所提供正文仅含 Simon Willison 的发布信息、标签与订阅推广,未提供性能评测或具体定价依据。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务中以约五分之一成本接近 Astra,相关基准均为官方初步结果。
推荐理由:同价位模型的缓存价格与多步任务成本对照,为高频复用上下文的智能体工作流提供了比单看榜单分数更具体的选型依据。
OpenAI 在 9 月 29 日于旧金山举行的 DevDay 2026 上公布 GPT-6.1 Sol 模型和 AI 智能体产品 Dots。Dots 对标 Meta 近期推出的 Muse,但不同于免费开放的 Muse,初期仅面向 ChatGPT Pro、Business Premium 和 Enterprise 付费订阅用户。
OpenAI 在 DevDay 2026 宣布推出 GPT-6.1 Sol,称其以 Astra 五分之一的价格提供接近其水平的智能,并推出个人智能体 Dots 和协作空间 ChatGPT Space。
推荐理由:现场记录将产品发布承诺与演示中的停顿、语音交互失败并置,为理解智能体功能展示与实际使用体验之间的差异提供具体参照。
NVIDIA 发布开放表格基础模型 Kumo Tabular,利用带标签行作为上下文,单次前向传播即可完成分类或回归,无需针对任务训练、调参或特征工程。
推荐理由:相较每个任务重新训练的表格建模流程,上下文学习把带标签样本直接用于预测,为减少特征工程与调参提供了具体路径。
OpenAI 发布 GPT-6.1 Sol,称其在编码、计算机使用和专业工作方面具备接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:原文将接近 Astra 的智能水平与其五分之一的标准 API 输入输出 token 价格并列,为比较能力与成本提供了参照。
Anthropic 发布 Claude Sonnet 5.5,定价与 Sonnet 5 相同,并称运行速度提升 30%+、多数任务成本最多降低 30%;该模型现已用于 claude.ai 免费层。
推荐理由:实测对比了不同思考强度下的生成结果与成本,展示了更高的思考预算不一定能换来可用输出这一具体问题。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
LFM2.5-VL-DSpark 通过推测解码加速 LFM2.5-VL-3B,端侧解码最高提速 3.13x,且不改变输出质量。草稿模型增加约 280M 参数,增幅为 8.9%,端侧端到端最高提速 2.62x。模型已开放权重,支持 llama.cpp、MLX-VLM 和 SGLang。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
Microsoft Research 的 RetroChimera 通过集成互补模型改进小分子逆合成预测,盲测中其单步反应预测更受专家化学家青睐。模型结合 R-SMILES 2 与 NeuralLoc,在 10 个高难度目标中有 9 个的完整合成路线获专家认可。相关研究已发表于 Nature,实现代码与权重已开源。
NVIDIA CEO 黄仁勋在 Dreamforce 表示,AI 作为基础设施将让人们“知晓一切、做到任何事”,并强调创新速度与安全可以兼顾。同期公布的 Salesforce 首款 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 构建,已在内部运行,计划于 10 月进入客户试点。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,接入实时卫星观测,每小时生成新预报,温度和湿度等关键地表变量分辨率达到 5-kilometer。
推荐理由:与前代相比,实时卫星观测和逐小时更新缩短了预报的信息滞后,更细的空间分辨率有助于理解局地天气变化与能源规划需求。
NeoMME 推出 260M 和 800M 多语言多模态编码器,以单一双向 Transformer 处理文本和图像,全部检查点按 Apache 2.0 许可开放。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。
GigaPath-Flash 与 GigaTIME-Flash 通过知识蒸馏降低病理分析计算需求,支持更大患者队列的研究。GigaPath-Flash 在切片分类基准上与原模型得分差距不超过 3%,计算量约为其五十分之一。两款模型均以 Apache 2.0 许可开放,仅供研究,未经临床用途验证。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。
推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。
Google Research 构建了连续血糖监测基础模型 GlucoFM,以双流设计区分缓慢血糖趋势与短期波动,支持有限标注数据下的临床预测。在相同数据预训练的对比中,其在14项队列—任务评估中的平均 PR-AUC 为58.8,较最强 CGM 专用基线高4.1点。餐后血糖预测的跨设备平均绝对误差也最低。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
Liquid AI 发布适配 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,实测 H100 上最高加速 3.18x,M4 Max 上最高加速 2.87x。
Microsoft Research 扩大 Skala 的软件支持范围,现已在 CP2K 中可用,并正集成至 Psi4、FHI-aims、ORCA 和 VASP。Skala-1.1 在 GMTKN55 上的加权平均误差为 2.8 kcal/mol。团队还推出持续更新的基准,追踪后续版本的计算性能。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
Google DeepMind 发布手语转文本模型 SL2T,为 Pixel 11 的 Gboard 和 Live Transcribe 提供 ASL 转英文输入功能。
推荐理由:将手语输入接入手机日常输入场景,让无障碍交互不再只依赖英文打字,同时通过仅上传身体坐标减少原始视频传输。
Microsoft Research 介绍胸部 X 光研究模型 CARE-X,结合报告生成、分类与定位辅助头及 DAPO 强化学习,在 ReXVQA 上达到 94% 总体准确率。
Google DeepMind 的 WeatherNext 在气旋路径、强度和风场结构预测中达到 SOTA 精度,平均三天预报可达到以往模型两天预报的准确度。发表于 Nature 的研究基于 2023 至 2024 年历史气旋进行评测,模型可在单个 TPU 上用不到一分钟生成一次 15 天预报,今年每个气旋的集合预测已扩展至 1,000 种可能情景。
推荐理由:以相同预报精度比较提前量,比单看误差更容易理解模型进步的实际意义,也为评估气旋预报工具提供了具体参照。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。
Google DeepMind 今日开始在 Google Flow Music 推出音乐生成模型 Lyria 3.5,提升音乐性、歌词与人声质量。该模型支持生成更丰富、复杂且自然的旋律结构,改善歌词对提示词的遵循和结构感知,并让人声更逼真、情感表达更细腻、发音更准确。用户还可以更轻松地控制生成作品的节奏与时长。
推荐理由:此次更新同时涉及歌曲生成质量与节奏、时长控制,为判断音乐生成模型能否更贴合具体创作要求提供了清晰的比较维度。
Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。
推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别面向复杂智能体任务、高吞吐工作流和漏洞发现与修复。
推荐理由:同一系列按复杂任务、高吞吐和漏洞修复划分用途,并给出成本与访问边界,为生产智能体的模型选型提供了具体比较依据。
Google 推出 Gemini 3.5 Flash Cyber,这款基于 3.5 Flash 微调的轻量网络安全模型专用于快速发现、验证和修复漏洞。在固定调用次数的 V8 测试中,该模型发现 55 个已确认的独特问题,主线 3.5 Flash 和 Claude Opus 4.6 分别发现 47 个和 36 个,其中 10 个问题未被另外两个模型发现。
推荐理由:轻量模型的低成本让安全智能体能够反复探索更多代码路径,为比较漏洞发现方案提供了单次模型能力之外的架构视角。
Google DeepMind 发布 Nano Banana 2 Lite,并向开发者开放 Gemini Omni Flash,分别用于快速图像生成和视频生成、对话式编辑。
推荐理由:文中明确区分图像模型的速度、成本与质量定位,并列出视频模型的输入处理限制,为多媒体工作流选型提供具体依据。
Google Research 发布表格基础模型 TabFM,通过上下文学习对未见过的表格进行分类与回归,无需针对新任务训练模型或调参。模型完全使用数亿个合成数据集训练,结合行列交替注意力、行压缩与 Transformer 架构,标准配置通过单次前向传播生成预测,另提供加入交叉特征、SVD 特征的 32 路集成配置 TabFM-Ensemble。
推荐理由:把表格预测改为上下文学习,为减少逐数据集训练和调参提供了不同路径,文中还区分了直接预测与加入特征工程的集成配置。
Google DeepMind 发布实验性开放模型 DiffusionGemma,以 Apache 2.0 许可提供权重,在专用 GPU 上实现最高 4x 的文本生成速度。
推荐理由:本地低并发与高并发云端的收益差异交代清楚,能帮助开发者结合输出质量取舍判断文本扩散是否适合自己的工作负载。