Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。
OpenAI 在 DevDay 2026 推出 GPT-6.1 Sol、常驻智能体 Dots 及多项平台更新,称 Sol 以 Astra 的 1/5 价格提供接近其水平的智能。
推荐理由:将模型价格、常驻智能体和订阅额度调整放在一起比较,有助于区分单次调用降价与整体使用成本变化对工作流的不同影响。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务中以约五分之一成本接近 Astra,相关基准均为官方初步结果。
推荐理由:同价位模型的缓存价格与多步任务成本对照,为高频复用上下文的智能体工作流提供了比单看榜单分数更具体的选型依据。
OpenAI 在 DevDay 2026 宣布推出 GPT-6.1 Sol,称其以 Astra 五分之一的价格提供接近其水平的智能,并推出个人智能体 Dots 和协作空间 ChatGPT Space。
推荐理由:现场记录将产品发布承诺与演示中的停顿、语音交互失败并置,为理解智能体功能展示与实际使用体验之间的差异提供具体参照。
NVIDIA 发布开放表格基础模型 Kumo Tabular,利用带标签行作为上下文,单次前向传播即可完成分类或回归,无需针对任务训练、调参或特征工程。
推荐理由:相较每个任务重新训练的表格建模流程,上下文学习把带标签样本直接用于预测,为减少特征工程与调参提供了具体路径。
OpenAI 发布 GPT-6.1 Sol,称其在编码、计算机使用和专业工作方面具备接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:原文将接近 Astra 的智能水平与其五分之一的标准 API 输入输出 token 价格并列,为比较能力与成本提供了参照。
Anthropic 发布 Claude Sonnet 5.5,定价与 Sonnet 5 相同,并称运行速度提升 30%+、多数任务成本最多降低 30%;该模型现已用于 claude.ai 免费层。
推荐理由:实测对比了不同思考强度下的生成结果与成本,展示了更高的思考预算不一定能换来可用输出这一具体问题。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度声音创作与高用量、成本高效的语音生成。
推荐理由:两款模型分别面向角色声音设计与高用量语音生成,创作控制和规模成本的定位差异为不同音频工作流提供了选型依据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,接入实时卫星观测,每小时生成新预报,温度和湿度等关键地表变量分辨率达到 5-kilometer。
推荐理由:与前代相比,实时卫星观测和逐小时更新缩短了预报的信息滞后,更细的空间分辨率有助于理解局地天气变化与能源规划需求。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。
推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
Google DeepMind 发布手语转文本模型 SL2T,为 Pixel 11 的 Gboard 和 Live Transcribe 提供 ASL 转英文输入功能。
推荐理由:将手语输入接入手机日常输入场景,让无障碍交互不再只依赖英文打字,同时通过仅上传身体坐标减少原始视频传输。
Google DeepMind 的 WeatherNext 在气旋路径、强度和风场结构预测中达到 SOTA 精度,平均三天预报可达到以往模型两天预报的准确度。发表于 Nature 的研究基于 2023 至 2024 年历史气旋进行评测,模型可在单个 TPU 上用不到一分钟生成一次 15 天预报,今年每个气旋的集合预测已扩展至 1,000 种可能情景。
推荐理由:以相同预报精度比较提前量,比单看误差更容易理解模型进步的实际意义,也为评估气旋预报工具提供了具体参照。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。