跳到正文

#编码

今日 8 条
今天9月30日周三
  1. TechCrunch · AI80

    OpenAI 发布 GPT-6.1 Sol,称性能接近 GPT-6 Astra、价格降至五分之一

    OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。

    推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。

  2. AWS Machine Learning Blog69

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,将接近 Astra 的智能带入日常工作

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。

    推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。

  3. The Decoder80

    GPT-6.1 Sol 据称以五分之一成本接近 Astra 表现

    OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务中以约五分之一成本接近 Astra,相关基准均为官方初步结果。

    推荐理由:同价位模型的缓存价格与多步任务成本对照,为高频复用上下文的智能体工作流提供了比单看榜单分数更具体的选型依据。

9月29日周二
  1. Simon Willison77

    OpenAI DevDay 2026 现场实录:GPT-6.1 Sol、Dots 与开发者平台更新

    OpenAI 在 DevDay 2026 宣布推出 GPT-6.1 Sol,称其以 Astra 五分之一的价格提供接近其水平的智能,并推出个人智能体 Dots 和协作空间 ChatGPT Space。

    推荐理由:现场记录将产品发布承诺与演示中的停顿、语音交互失败并置,为理解智能体功能展示与实际使用体验之间的差异提供具体参照。

  2. Latent Space70

    Claude Opus 5.5 在讲解视频制作中表现亮眼

    Claude Opus 5.5 本周发布后获得积极的社区反馈,其中通过代码制作讲解视频和动画的案例尤为突出。一位用户称,Claude Code 为 Friendr.nl 自主制作了 30–60s 讲解视频,耗时约 1.5–2h、花费约 $4,涵盖脚本、素材、TTS 配音及以 JavaScript canvas 动画渲染 MP4,并调用另一模型自检。

  3. Latent Space74

    Claude Code 的下一阶段:对话 Anthropic 的 Thariq Shihipar

    Anthropic 的 Thariq Shihipar 在访谈中讨论 Claude Code 如何走向可定制执行框架、多人协作与云端和本地分工。Claude Mods 可修改执行循环和界面,而他设想的后续架构将云端智能、本地或远程执行与动态界面分离。他强调提前澄清需求、按任务选择 effort 并记录实现决策的重要性,也讨论了智能体获得更多数据和工具权限后的安全问题。

9月28日周一
  1. Simon Willison61

    Simon Willison 回顾 2026 年至今的 LLM 趋势与编码智能体变化

    Simon Willison 在大会闭幕演讲中回顾 2026 年至今的 LLM 发展,将编码智能体走向日常可用视为核心变化。他结合 Claude Code、Codex 的使用经历及本地千问模型的 SVG 绘图测试,讨论能力提升、token 成本和智能体安全问题,并梳理文中所述的训练智能体突破沙箱事件。他的核心判断是,智能体接手简单任务后,工程师仍需承担目标定义、约束设计与质量验证,工作未必更轻松。

9月25日周五
  1. GitHub Blog · AI & ML65

    何时聊天不是合适的界面:GitHub Copilot canvas 的任务导向实践

    GitHub Copilot 应用中的 canvas 可构建任务专用界面,Burke Holland 用实例说明何时应以它替代聊天交互。canvas 是运行于应用内的全栈小程序,可与 Copilot 智能体双向通信、调用第三方 API 并在本机执行代码,文中展示了四子棋、Winget 包管理和 SQLite 操作等用途。

    推荐理由:把重复操作从聊天转为智能体生成的专用界面,为减少反复调用模型及按需设置开发流程中的人工审查节点提供了具体思路。

9月24日周四
  1. GitHub Blog · AI & ML48

    GitHub Copilot 应用如何渲染超大型拉取请求

    GitHub Copilot 应用重构拉取请求视图,让庞大的代码差异与审查讨论仍能流畅渲染。团队以包含 2,200 个文件、超过百万行变更和超过 400 条行内审查评论的开源拉取请求进行测试。方案保留代码行虚拟化,将固定代码高度与动态评论高度分开计算,通过延迟测量及锚定修正减少滚动跳动。

9月18日周五
  1. GitHub Blog · AI & ML46

    GitHub Podcast 探讨:该读 AI 生成的代码吗,RAG 已死,技能取代了 MCP?

    GitHub Podcast 剖析 AI 开发热议观点:生成代码仍需审查,RAG 并未过时,技能也未取代 MCP。代码审查应按风险分配精力,直到开发者能解释结果并承担责任。MCP 提供工具与数据访问,技能承载流程和最佳实践,RAG 检索相关上下文,三者可在同一智能体工作流中配合。

9月17日周四
9月11日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 入门:使用 diff、终端和浏览器面板

    GitHub Copilot app 可通过内置 diff、终端和浏览器面板,在应用内完成智能体代码的审查、运行与预览。diff 面板展示增删改动并支持接受改动、评论或要求修改;终端支持手动运行命令,也可配置通过 Run 按钮执行的脚本,例如运行 npm run dev。浏览器面板可测试界面,并通过 Pick & Polish 选择元素与智能体一起调整,确认功能后可直接接受改动并创建拉取请求。

9月9日周三
9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML52

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 可通过会话视图管理多个并行智能体任务,每个会话可在自己的 Git worktree 中运行,彼此隔离。各会话保留独立上下文,切换后无需重新说明任务,会话卡片显示任务标题和进度。教程以 tailspin-toys 仓库为例,演示同时开展 funded sort 功能开发、无障碍审查和测试,并在任务完成后逐一查看结果。

9月3日周四
  1. Hugging Face Blog76

    funes 为编码智能体提供用户自有、可跨机器检索的记忆

    Hugging Face 的开源工具 funes 将已有会话转为持久记忆,支持 Claude Code、Codex、pi 和 Hermes 跨智能体检索。嵌入与重排序在本机运行,检索返回原文及会话出处;用户可选择同步至自己拥有、默认私有的 Hugging Face 数据集,实现跨机器共享。

    推荐理由:将会话原文连同出处保留为可检索数据,为跨智能体交接提供了不同于压缩摘要的路径,也让过去决策的依据能够被追溯。

  2. Google DeepMind60

    Google Fairwind Program 为政府与企业提供主动网络防御能力

    Google 推出限量开放的 Fairwind Program,向可信的 Google Cloud 客户、政府机构和网络安全伙伴提供自主发现与修复漏洞的能力。该计划结合 Gemini 3.8 Flash Cyber 与 CodeMender,Google 称其可在组织的安全云环境中,将人工修复所需的数周缩短为数分钟,生成经过验证、可部署的补丁。

    推荐理由:将漏洞发现、验证与修补放在同一流程中,提供了观察防御团队如何缩短修复周期并在受控云环境中应用智能体的具体案例。

8月24日周一
  1. Import AI50

    Import AI 470:不给机器权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU 内核

    多所大学的研究人员开发了 SPADE,通过自博弈交替生成可执行训练环境并学习求解,提升模型在游戏和工具使用任务中的表现。在游戏评测中,30B-A3B 规模模型的套件平均分达 58.3,较基础模型提高 8.1,较最强固定环境基线提高 5.3。该方法仍受限于生成环境所用基础模型的想象能力。

8月14日周五
7月29日周三
7月26日周日
  1. Berkeley AI Research48

    ABBEL:教大语言模型更新信念,实现高效长程交互

    ABBEL 通过监督自然语言信念状态的更新,改善大语言模型在长程交互中压缩上下文后的表现。在协作编程环境 CollabBench 中,相比不采用信念评分的摘要训练,基于重建的信念评分将与完整上下文模型的性能差距缩小约 50%,训练步数减少 50%。训练后,其峰值上下文 token 用量仍显著低于完整上下文模型。

7月21日周二
7月17日周五
  1. Google DeepMind65

    Google 推出 Gemini 3.5 Flash Cyber,面向漏洞发现、验证与修复

    Google 推出 Gemini 3.5 Flash Cyber,这款基于 3.5 Flash 微调的轻量网络安全模型专用于快速发现、验证和修复漏洞。在固定调用次数的 V8 测试中,该模型发现 55 个已确认的独特问题,主线 3.5 Flash 和 Claude Opus 4.6 分别发现 47 个和 36 个,其中 10 个问题未被另外两个模型发现。

    推荐理由:轻量模型的低成本让安全智能体能够反复探索更多代码路径,为比较漏洞发现方案提供了单次模型能力之外的架构视角。

6月16日周二
  1. Google DeepMind61

    Google DeepMind 如何通过 AI Control Roadmap 保障 AI 智能体安全

    Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。

    推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。