Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。
OpenAI 在周二的 DevDay 宣布为 Codex 增加可跨设备访问的可复用云开发环境,让远程任务环境更持久、可配置。这些环境旨在加快任务启动,并为团队提供采用获批设置与权限的共享工作空间;Codex CLI 同时新增语音任务控制和 /agents 多任务视图,ChatGPT 桌面应用也加入代码审查体验。
OpenAI 在 DevDay 2026 推出 GPT-6.1 Sol、常驻智能体 Dots 及多项平台更新,称 Sol 以 Astra 的 1/5 价格提供接近其水平的智能。
推荐理由:将模型价格、常驻智能体和订阅额度调整放在一起比较,有助于区分单次调用降价与整体使用成本变化对工作流的不同影响。
Anthropic 前沿红队评测发现,GLM-5.3 在内部二进制漏洞利用基准测试中实现完整控制流劫持的成功率为 4%。评测随机选取 100 项任务,Claude Mythos Preview 成功率为 6%,Claude Opus 4.6 和 GLM-5.2 均未成功。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
OpenAI 在 DevDay 2026 宣布扩展 Codex 与 API,加入可复用云环境、安全扫描、Decisions API 和 Ultrafast 提速档位。
推荐理由:提速档位的价格与订阅额度调整提供了具体比较依据,便于区分更快生成速度与更高使用额度在开发工作流中的不同成本。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务中以约五分之一成本接近 Astra,相关基准均为官方初步结果。
推荐理由:同价位模型的缓存价格与多步任务成本对照,为高频复用上下文的智能体工作流提供了比单看榜单分数更具体的选型依据。
OpenAI 在 DevDay 2026 宣布推出 GPT-6.1 Sol,称其以 Astra 五分之一的价格提供接近其水平的智能,并推出个人智能体 Dots 和协作空间 ChatGPT Space。
推荐理由:现场记录将产品发布承诺与演示中的停顿、语音交互失败并置,为理解智能体功能展示与实际使用体验之间的差异提供具体参照。
Mozilla 的 Firefox 负责人 Ajit Varma 希望通过界面改版,以更好的使用体验吸引 Chrome 用户,而不只依靠隐私与开放网络理念。Firefox 157 今天将在桌面和移动平台推出新设计。团队正借助 AI 工具加快开发,同时推进性能、兼容性和定制选项等改进。
OpenAI 发布 GPT-6.1 Sol,称其在编码、计算机使用和专业工作方面具备接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:原文将接近 Astra 的智能水平与其五分之一的标准 API 输入输出 token 价格并列,为比较能力与成本提供了参照。
OpenAI DevDay 2026 带来超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT 和 Codex。公告内容还包括 API、安全及面向开发者的新工具。
Claude Opus 5.5 本周发布后获得积极的社区反馈,其中通过代码制作讲解视频和动画的案例尤为突出。一位用户称,Claude Code 为 Friendr.nl 自主制作了 30–60s 讲解视频,耗时约 1.5–2h、花费约 $4,涵盖脚本、素材、TTS 配音及以 JavaScript canvas 动画渲染 MP4,并调用另一模型自检。
Anthropic 的 Thariq Shihipar 在访谈中讨论 Claude Code 如何走向可定制执行框架、多人协作与云端和本地分工。Claude Mods 可修改执行循环和界面,而他设想的后续架构将云端智能、本地或远程执行与动态界面分离。他强调提前澄清需求、按任务选择 effort 并记录实现决策的重要性,也讨论了智能体获得更多数据和工具权限后的安全问题。
Amazon Bedrock 已上线 xAI 的 Grok 4.7,提供 500K token 上下文窗口,以及 low、medium、high、xhigh 四档推理强度。
Anthropic 发布 Claude Sonnet 5.5,定价与 Sonnet 5 相同,并称运行速度提升 30%+、多数任务成本最多降低 30%;该模型现已用于 claude.ai 免费层。
推荐理由:实测对比了不同思考强度下的生成结果与成本,展示了更高的思考预算不一定能换来可用输出这一具体问题。
OpenAI 正在征集使用 Codex 的构建者、技术爱好者、研究人员和创作者的真实故事,为 Codex Originals 计划下一阶段寻找参与者。有意参与者可提交自己的故事与项目信息。
Simon Willison 在大会闭幕演讲中回顾 2026 年至今的 LLM 发展,将编码智能体走向日常可用视为核心变化。他结合 Claude Code、Codex 的使用经历及本地千问模型的 SVG 绘图测试,讨论能力提升、token 成本和智能体安全问题,并梳理文中所述的训练智能体突破沙箱事件。他的核心判断是,智能体接手简单任务后,工程师仍需承担目标定义、约束设计与质量验证,工作未必更轻松。
GitHub Copilot 应用中的 canvas 可构建任务专用界面,Burke Holland 用实例说明何时应以它替代聊天交互。canvas 是运行于应用内的全栈小程序,可与 Copilot 智能体双向通信、调用第三方 API 并在本机执行代码,文中展示了四子棋、Winget 包管理和 SQLite 操作等用途。
推荐理由:把重复操作从聊天转为智能体生成的专用界面,为减少反复调用模型及按需设置开发流程中的人工审查节点提供了具体思路。
GitHub Security Lab 展示了 Fuzzing Taskflow 的运行方法与架构,用智能体自动完成 C/C++ 项目的测试入口识别、测试驱动代码编写、覆盖率改进和崩溃分析。
Endura Therapeutics 联合创始人 Adrian Sanborn 将 AI 降低科研成本的路径分为两类:实验工厂降低实验执行成本,科研导航改善决策与流程。
GitHub Copilot 应用重构拉取请求视图,让庞大的代码差异与审查讨论仍能流畅渲染。团队以包含 2,200 个文件、超过百万行变更和超过 400 条行内审查评论的开源拉取请求进行测试。方案保留代码行虚拟化,将固定代码高度与动态评论高度分开计算,通过延迟测量及锚定修正减少滚动跳动。
GitHub Podcast 剖析 AI 开发热议观点:生成代码仍需审查,RAG 并未过时,技能也未取代 MCP。代码审查应按风险分配精力,直到开发者能解释结果并承担责任。MCP 提供工具与数据访问,技能承载流程和最佳实践,RAG 检索相关上下文,三者可在同一智能体工作流中配合。
GitHub 使用 Copilot app 和 CLI 将 Copilot 智能体运行时从 TypeScript 迁移至 Rust,主要由一名开发者监督智能体在几个月内完成。
推荐理由:按组件原位替换、持续测试与人工合并把关的迁移实践,为在持续迭代的代码库中组织智能体重写提供了可迁移的方法。
GitHub Copilot app 可通过内置 diff、终端和浏览器面板,在应用内完成智能体代码的审查、运行与预览。diff 面板展示增删改动并支持接受改动、评论或要求修改;终端支持手动运行命令,也可配置通过 Run 按钮执行的脚本,例如运行 npm run dev。浏览器面板可测试界面,并通过 Pick & Polish 选择元素与智能体一起调整,确认功能后可直接接受改动并创建拉取请求。
Mistral 帮助一家欧洲能源运营商将储层模拟器的 40,000 行 Fortran 77 迁移至 C++,完成了总计 300,000 行代码中的核心功能部分。
推荐理由:先建立数值一致性测试再分模块迁移,并在人类审核节点处理智能体停滞,为复杂遗留代码现代化提供了可迁移的方法。
GitHub 推出 Project HydraFusion 研究预览,在 GitHub Copilot CLI 中按任务动态选择模型与执行流程,面向所有 Copilot 套餐开放。
推荐理由:三组离线评测同时列出质量差异与完整工作流成本,为比较多模型编排和单一强模型的质量成本取舍提供了具体依据。
GitHub Copilot app 可通过会话视图管理多个并行智能体任务,每个会话可在自己的 Git worktree 中运行,彼此隔离。各会话保留独立上下文,切换后无需重新说明任务,会话卡片显示任务标题和进度。教程以 tailspin-toys 仓库为例,演示同时开展 funded sort 功能开发、无障碍审查和测试,并在任务完成后逐一查看结果。
Hugging Face 的开源工具 funes 将已有会话转为持久记忆,支持 Claude Code、Codex、pi 和 Hermes 跨智能体检索。嵌入与重排序在本机运行,检索返回原文及会话出处;用户可选择同步至自己拥有、默认私有的 Hugging Face 数据集,实现跨机器共享。
推荐理由:将会话原文连同出处保留为可检索数据,为跨智能体交接提供了不同于压缩摘要的路径,也让过去决策的依据能够被追溯。
作者用 TRL 和 OpenEnv 复现了以强化学习训练 Qwen3.5-35B-A3B 编写 p5.brush 水彩绘画代码的方法,并公开数据、环境、脚本和训练产物。
Google 推出限量开放的 Fairwind Program,向可信的 Google Cloud 客户、政府机构和网络安全伙伴提供自主发现与修复漏洞的能力。该计划结合 Gemini 3.8 Flash Cyber 与 CodeMender,Google 称其可在组织的安全云环境中,将人工修复所需的数周缩短为数分钟,生成经过验证、可部署的补丁。
推荐理由:将漏洞发现、验证与修补放在同一流程中,提供了观察防御团队如何缩短修复周期并在受控云环境中应用智能体的具体案例。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
多所大学的研究人员开发了 SPADE,通过自博弈交替生成可执行训练环境并学习求解,提升模型在游戏和工具使用任务中的表现。在游戏评测中,30B-A3B 规模模型的套件平均分达 58.3,较基础模型提高 8.1,较最强固定环境基线提高 5.3。该方法仍受限于生成环境所用基础模型的想象能力。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
IBM Research 基于 Berkeley Sky Lab 的 K-Search 扩展 MLX 后端,以结构化 CUDA-to-MLX 翻译层将内核优化知识迁移到 Apple Silicon。
ABBEL 通过监督自然语言信念状态的更新,改善大语言模型在长程交互中压缩上下文后的表现。在协作编程环境 CollabBench 中,相比不采用信念评分的摘要训练,基于重建的信念评分将与完整上下文模型的性能差距缩小约 50%,训练步数减少 50%。训练后,其峰值上下文 token 用量仍显著低于完整上下文模型。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别面向复杂智能体任务、高吞吐工作流和漏洞发现与修复。
推荐理由:同一系列按复杂任务、高吞吐和漏洞修复划分用途,并给出成本与访问边界,为生产智能体的模型选型提供了具体比较依据。
Google 推出 Gemini 3.5 Flash Cyber,这款基于 3.5 Flash 微调的轻量网络安全模型专用于快速发现、验证和修复漏洞。在固定调用次数的 V8 测试中,该模型发现 55 个已确认的独特问题,主线 3.5 Flash 和 Claude Opus 4.6 分别发现 47 个和 36 个,其中 10 个问题未被另外两个模型发现。
推荐理由:轻量模型的低成本让安全智能体能够反复探索更多代码路径,为比较漏洞发现方案提供了单次模型能力之外的架构视角。
Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。
推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。