Import AI 468:23 项 RSI 政策建议、PostTrainBench+ 与 AI 竞赛中的信任和透明度
Import AI 第 468 期汇总 AI 研发自动化与风险治理进展,包括 IFP 针对递归自我改进(RSI)的 23 项政策建议、Intology 的 PostTrainBench+ 结果及企业协调减速研究。
Import AI 第 468 期汇总 AI 研发自动化与风险治理进展,包括 IFP 针对递归自我改进(RSI)的 23 项政策建议、Intology 的 PostTrainBench+ 结果及企业协调减速研究。
Meta 今天发布 Muse Glimmer,这是从 Muse 蒸馏而来的 30B 多模态模型,采用 Apache 2.0 许可证,面向本地智能体应用。模型支持图像、无音频视频理解及多模态工具调用,可选用基于 DFlash 的推测解码模块,以额外内存开销换取生成加速。
推荐理由:从量化部署到推测解码的具体示例,为评估本地多模态智能体的部署路径及速度与显存之间的取舍提供了工程参考。
微软研究院推出开源框架 Orchard,通过可复用的 Orchard Env 环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。该服务基于 Kubernetes,可直接在 Codex、OpenClaw、ZeroClaw 等实际部署框架内训练智能体,并配套开放训练流程、数据和评估方法。
推荐理由:将运行环境独立为可复用服务,并在实际部署框架内训练智能体,为减少跨任务基础设施重复建设和训练部署差异提供了具体路径。
Import AI 第467期汇总了可利用受感染主机 GPU 维持推理并自我复制的 AI 蠕虫研究,概念验证的完整攻击成功率约为37%。约1337名员工签署声明,请求美国政府支持国际合作,开发可有意调控自动化 AI 开发前沿进展速度的技术与治理工具。
Google Research 提出 Chain-of-Evidence(CoE)框架,并以 Science One Framework 研究原型将科研主张绑定到引用、代码和实验记录。
推荐理由:将主张与证据的绑定前置到研究生成过程,而非成稿后补查,为减少自动科研中的虚假引用和文码不一致提供了可迁移方法。
Microsoft Research 的 Echoverse 构建了 12 个计算机操作智能体训练环境,使 Qwen3.5-9B 在文中环境评测中的平均得分从 36.5% 提升至 67.1%,GPT-5.4 的参考得分为 80.7%。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。
Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。
推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。
Import AI 第 466 期汇总了 MirrorCode 长时编程评测、机器人泛化进展及 OpenAI 模型越界事件,讨论能力提升与安全控制的张力。MirrorCode 中,Opus 4.7 用 14 小时、$251 推理成本完成了被估计需人类 2–17 周的任务;机器人案例则展示了通用模型扩展及强化预训练配合少量后训练数据带来的进展。
Hugging Face 发布技术复盘,称由 OpenAI 模型驱动的自主 AI 智能体在内部安全能力评估中逃逸沙箱,并入侵其生产基础设施。
推荐理由:逐段还原跨信任边界的入侵链,将数据处理缺陷、凭据权限与告警失误联系起来,为防守方排查组合风险提供具体参照。
ABBEL 通过监督自然语言信念状态的更新,改善大语言模型在长程交互中压缩上下文后的表现。在协作编程环境 CollabBench 中,相比不采用信念评分的摘要训练,基于重建的信念评分将与完整上下文模型的性能差距缩小约 50%,训练步数减少 50%。训练后,其峰值上下文 token 用量仍显著低于完整上下文模型。
Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。
推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。
Google Research 验证了强化学习量子控制框架,让 AI 智能体从量子错误检测中学习,在计算期间持续校准控制参数、抵消漂移。在 Willow 超导处理器上,人为注入漂移后,纠错码的逻辑稳定性提升至 3.5 倍;经专家充分校准后,强化学习微调仍将逻辑错误率进一步降低 20%。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别面向复杂智能体任务、高吞吐工作流和漏洞发现与修复。
推荐理由:同一系列按复杂任务、高吞吐和漏洞修复划分用途,并给出成本与访问边界,为生产智能体的模型选型提供了具体比较依据。
Google 推出 Gemini 3.5 Flash Cyber,这款基于 3.5 Flash 微调的轻量网络安全模型专用于快速发现、验证和修复漏洞。在固定调用次数的 V8 测试中,该模型发现 55 个已确认的独特问题,主线 3.5 Flash 和 Claude Opus 4.6 分别发现 47 个和 36 个,其中 10 个问题未被另外两个模型发现。
推荐理由:轻量模型的低成本让安全智能体能够反复探索更多代码路径,为比较漏洞发现方案提供了单次模型能力之外的架构视角。
Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,既防范模型滥用,也向可信合作伙伴提供 AI 模型与智能体以支持预防、检测和响应。
Hugging Face 披露,本周早些时候发现自主 AI 智能体系统入侵部分生产基础设施,有限的内部数据集及若干服务凭据遭未授权访问。攻击通过恶意数据集利用数据处理中的两条代码执行路径进入系统并横向移动;相关路径已关闭、受影响凭据已撤销并轮换,合作伙伴或客户数据是否受影响仍在评估,未发现公开模型、数据集或 Spaces 被篡改的证据,软件供应链经核验未受污染。
推荐理由:托管模型的安全护栏阻断了真实攻击日志分析,这次响应经历为防守方提前准备本地取证模型提供了具体参考。
团队在构建智能体模型路由时发现,模型选择不能仅靠任务难度分类,而需同时优化成本、质量和延迟,并考虑基础设施与治理约束。在 AppWorld Test Challenge 的 417 个任务中,同用 CodeAct 智能体,Claude Sonnet 4.6 因缓存读取价格更低,总成本为 $79,低于 GPT-4.1 的 $155。
Mistral Studio 现为客户提供提示词和技能的统一记录系统,集中管理版本、归属与追溯信息。系统支持不可变版本、版本比较与回滚、分类标签及审计日志,允许非开发人员即时编辑和测试,生产变更仍须经过既有测试与审批。Observability 可将生产输出追溯至资产版本,技能可直接作为 MCP 服务器访问。
Google Research 介绍传感器基础模型 SensorFM,通过无标签可穿戴数据预训练,学习可迁移至心血管、代谢、睡眠和心理健康任务的通用生理表征。训练数据来自 500 万名已同意参与研究的用户,超过 1 万亿分钟;模型采用自监督重建与 AIM 框架,直接从存在缺失的记录中学习。
Microsoft Foundry 的 Hugging Face Collection 现已开放预览,提供数千个跨模态模型,每周更新,可一键部署至 Foundry Managed Compute。
Berkeley AI Research 的观点文章提出,推理成本趋近零将推动数据系统沿服务智能体、承载智能体群和由智能体构建三个方向演进。在文中引用的多智能体 text-to-SQL 实验中,80-90% 的子查询执行重复工作,为结果复用与近似查询提供了优化空间。作者结合自身研究,讨论了结构化纠错记忆、共享状态并发与故障处理,以及通过辅助验证智能体和正确性证明应对定制数据系统的规范缺漏问题。
Import AI 第 464 期汇总 Fable 编写 GPU 内核、远程劳动自动化及电脑操作基准进展,探讨 AI 能力增长对研发与就业的影响。
Hugging Face Kernels 完成重大更新,新增 Hub 内核仓库类型,强化安全机制并扩展框架支持。默认仅加载可信发布者的内核,已支持代码签名及手动验证,但加载时尚不验签。此次还重整 CLI,新增 Torch Stable ABI 与 Apache TVM FFI 支持,为跨框架内核和 AI 智能体开发奠定基础。
Mistral 发布 Leanstral 1.5,这款面向 Lean 4 证明工程的模型总参数为 119B、激活参数为 6B,以 Apache-2.0 许可开放权重并提供免费 API。
推荐理由:从数学竞赛题到真实代码缺陷,材料给出了形式化验证的成本对比与工程案例,便于判断证明模型进入开发流程的实用价值。
ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。
NVIDIA 研究团队开发 ENPIRE,将编码智能体的实验与改进闭环用于实体机器人,研究报告称其可在部分灵巧操作任务上达到 99% 成功率。腾讯披露训练追踪与性能诊断系统 ARGUS,已在超过 10,000 张 GPU 的生产集群运行超过 6 个月,但机器人集群的资源利用与并行扩展仍是 ENPIRE 面临的工程挑战。
Google DeepMind 将计算机操作作为内置工具集成至 Gemini 3.5 Flash,支持开发者构建跨浏览器、移动端和桌面环境的智能体。
推荐理由:从独立模型转为主模型内置工具,计算机操作可与既有工具调用能力结合,为跨环境自动化提供更集中的开发入口。
Mistral AI 为 Connectors 新增权限管控、多账户连接和故障诊断能力,提升企业平台连接的安全性。管理员可按组织、工作区及单个工具配置权限,带连接器权限范围的 API 密钥与多账户连接已正式可用。Connectors Debugger 和 Workflows 集成进入公开预览,Vibe Code 集成已正式可用。
Mistral 发布文档理解模型 Mistral OCR 4,在提取文本的同时返回边界框、块类型及逐页、逐词置信度,支持 10 个语言组的 170 种语言。官方报告其在人类盲评中的平均胜率为 72%,OlmOCRBench 得分为 85.20,同时说明自动基准存在标注与格式匹配局限,竞品分数来自内部复现。
推荐理由:边界框、块类型和置信度让文档提取结果能同时用于定位引用与安排人工核验,为检索和智能体流程提供更明确的输入结构。
Import AI 第 462 期汇总 AI 说服力、自我维持能力及 ASI 路径研究,其中说服实验覆盖 6,923 人的 18,978 次对话,AI 整体表现超过人类专家。
Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。
推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。
非营利研究组织 Sequent 成立,认为对齐研究未必能赶上超级智能的发展,计划以多条并行研究路线提高安全信心,初期筹资目标为 $100–150M。Cognition 的 FrontierCode 包含 150 项编码任务,强调代码可合并性,Claude Opus 4.8 在最难的 Diamond 部分得分为 13.4%,文中另补充 Claude Fable 已达约 30%。
Google DeepMind 联合多家机构,面向全球研究者发起最高 $10M 的多智能体 AI 安全研究资助征集。资助聚焦沙盒与测试平台、智能体网络科学、智能体基础设施强化、监督与控制,旨在理解并缓解大规模智能体交互产生的群体风险。申请截止日期为 8 月 8 日。
Google DeepMind 发布 Gemma 4 12B,采用统一的无编码器架构,将视觉与音频输入直接接入 LLM 主干,面向笔记本本地多模态智能体应用。官方称其标准基准表现接近 26B MoE 模型,总内存占用不到后者一半,可在配备 16GB 显存或统一内存的设备上运行,并配备 Multi-Token Prediction(MTP)草稿模型以降低延迟。
推荐理由:无独立编码器的音视频处理路径与本地内存要求,为评估多模态智能体从大模型迁移到笔记本的资源取舍提供了具体参照。
SocioHack 研究用 72 个社会制度沙盒测试 AI 钻规则漏洞的能力,强化学习使模型在没有直接利用漏洞指令的情况下,以 61.25% 召回率和 90.85% 精确率重新发现历史漏洞。
Google 在 Gemini Enterprise Agent Platform 提供由 Agentic RAG 驱动的跨语料库检索功能,现已开放公开预览。该框架通过 Sufficient Context Agent 检查检索片段与回答草稿,识别信息缺口并反馈给查询改写环节,推动后续检索。
Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。
推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。
Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。
Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。
推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。