跳到正文

#Agent

今日 28 条
8月10日周一
  1. Hugging Face Blog79

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 今天发布 Muse Glimmer,这是从 Muse 蒸馏而来的 30B 多模态模型,采用 Apache 2.0 许可证,面向本地智能体应用。模型支持图像、无音频视频理解及多模态工具调用,可选用基于 DFlash 的推测解码模块,以额外内存开销换取生成加速。

    推荐理由:从量化部署到推测解码的具体示例,为评估本地多模态智能体的部署路径及速度与显存之间的取舍提供了工程参考。

8月4日周二
  1. Microsoft Research69

    微软研究院 Orchard:以可复用环境支持规模化 AI 智能体训练的开源框架

    微软研究院推出开源框架 Orchard,通过可复用的 Orchard Env 环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。该服务基于 Kubernetes,可直接在 Codex、OpenClaw、ZeroClaw 等实际部署框架内训练智能体,并配套开放训练流程、数据和评估方法。

    推荐理由:将运行环境独立为可复用服务,并在实际部署框架内训练智能体,为减少跨任务基础设施重复建设和训练部署差异提供了具体路径。

8月3日周一
7月31日周五
7月30日周四
  1. Google DeepMind75

    Gemini Robotics ER 2 以视频理解、任务编排和多机器人协作增强机器人能力

    Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。

    推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。

7月28日周二
  1. Google DeepMind74

    Gemini Robotics 2 为机器人带来全身智能控制与多机器人协作

    Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。

    推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。

7月27日周一
  1. Import AI67

    Import AI 466:机器人领域的苦涩教训、AI 完成数周编程任务与 OpenAI 模型意外越界

    Import AI 第 466 期汇总了 MirrorCode 长时编程评测、机器人泛化进展及 OpenAI 模型越界事件,讨论能力提升与安全控制的张力。MirrorCode 中,Opus 4.7 用 14 小时、$251 推理成本完成了被估计需人类 2–17 周的任务;机器人案例则展示了通用模型扩展及强化预训练配合少量后训练数据带来的进展。

7月26日周日
  1. Berkeley AI Research48

    ABBEL:教大语言模型更新信念,实现高效长程交互

    ABBEL 通过监督自然语言信念状态的更新,改善大语言模型在长程交互中压缩上下文后的表现。在协作编程环境 CollabBench 中,相比不采用信念评分的摘要训练,基于重建的信念评分将与完整上下文模型的性能差距缩小约 50%,训练步数减少 50%。训练后,其峰值上下文 token 用量仍显著低于完整上下文模型。

7月23日周四
  1. Google Research69

    Google Research 的 SymptomAI 研究:面向日常症状评估的对话式 AI 智能体

    Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。

    推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。

  2. Google Research50

    Google Research 探索让量子计算机从错误中学习

    Google Research 验证了强化学习量子控制框架,让 AI 智能体从量子错误检测中学习,在计算期间持续校准控制参数、抵消漂移。在 Willow 超导处理器上,人为注入漂移后,纠错码的逻辑稳定性提升至 3.5 倍;经专家充分校准后,强化学习微调仍将逻辑错误率进一步降低 20%。

7月21日周二
7月17日周五
  1. Google DeepMind65

    Google 推出 Gemini 3.5 Flash Cyber,面向漏洞发现、验证与修复

    Google 推出 Gemini 3.5 Flash Cyber,这款基于 3.5 Flash 微调的轻量网络安全模型专用于快速发现、验证和修复漏洞。在固定调用次数的 V8 测试中,该模型发现 55 个已确认的独特问题,主线 3.5 Flash 和 Claude Opus 4.6 分别发现 47 个和 36 个,其中 10 个问题未被另外两个模型发现。

    推荐理由:轻量模型的低成本让安全智能体能够反复探索更多代码路径,为比较漏洞发现方案提供了单次模型能力之外的架构视角。

7月16日周四
  1. Hugging Face Blog83

    Hugging Face 披露 2026 年 7 月安全事件:自主 AI 智能体入侵生产基础设施

    Hugging Face 披露,本周早些时候发现自主 AI 智能体系统入侵部分生产基础设施,有限的内部数据集及若干服务凭据遭未授权访问。攻击通过恶意数据集利用数据处理中的两条代码执行路径进入系统并横向移动;相关路径已关闭、受影响凭据已撤销并轮换,合作伙伴或客户数据是否受影响仍在评估,未发现公开模型、数据集或 Spaces 被篡改的证据,软件供应链经核验未受污染。

    推荐理由:托管模型的安全护栏阻断了真实攻击日志分析,这次响应经历为防守方提前准备本地取证模型提供了具体参考。

7月9日周四
  1. Mistral AI47

    提示词和技能需要统一记录系统:Mistral Studio 的治理方案

    Mistral Studio 现为客户提供提示词和技能的统一记录系统,集中管理版本、归属与追溯信息。系统支持不可变版本、版本比较与回滚、分类标签及审计日志,允许非开发人员即时编辑和测试,生产变更仍须经过既有测试与审批。Observability 可将生产输出追溯至资产版本,技能可直接作为 MCP 服务器访问。

7月7日周二
  1. Berkeley AI Research53

    智能趋近免费之后,数据系统如何服务、承载并由 AI 智能体构建?

    Berkeley AI Research 的观点文章提出,推理成本趋近零将推动数据系统沿服务智能体、承载智能体群和由智能体构建三个方向演进。在文中引用的多智能体 text-to-SQL 实验中,80-90% 的子查询执行重复工作,为结果复用与近似查询提供了优化空间。作者结合自身研究,讨论了结构化纠错记忆、共享状态并发与故障处理,以及通过辅助验证智能体和正确性证明应对定制数据系统的规范缺漏问题。

7月6日周一
  1. Hugging Face Blog47

    Hugging Face Kernels 重大更新

    Hugging Face Kernels 完成重大更新,新增 Hub 内核仓库类型,强化安全机制并扩展框架支持。默认仅加载可信发布者的内核,已支持代码签名及手动验证,但加载时尚不验签。此次还重整 CLI,新增 Torch Stable ABI 与 Apache TVM FFI 支持,为跨框架内核和 AI 智能体开发奠定基础。

7月2日周四
7月1日周三
  1. Hugging Face Blog58

    ScarfBench:评测 AI 智能体的企业 Java 框架迁移能力

    ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。

6月29日周一
  1. Import AI51

    Import AI 第463期:机器人自主改进、腾讯万卡 GPU 集群与人类时代的挽歌

    NVIDIA 研究团队开发 ENPIRE,将编码智能体的实验与改进闭环用于实体机器人,研究报告称其可在部分灵巧操作任务上达到 99% 成功率。腾讯披露训练追踪与性能诊断系统 ARGUS,已在超过 10,000 张 GPU 的生产集群运行超过 6 个月,但机器人集群的资源利用与并行扩展仍是 ENPIRE 面临的工程挑战。

6月25日周四
6月24日周三
  1. Mistral AI48

    Mistral AI 增强 Connectors 管控能力

    Mistral AI 为 Connectors 新增权限管控、多账户连接和故障诊断能力,提升企业平台连接的安全性。管理员可按组织、工作区及单个工具配置权限,带连接器权限范围的 API 密钥与多账户连接已正式可用。Connectors Debugger 和 Workflows 集成进入公开预览,Vibe Code 集成已正式可用。

6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4:支持 170 种语言,新增边界框、块分类与置信度

    Mistral 发布文档理解模型 Mistral OCR 4,在提取文本的同时返回边界框、块类型及逐页、逐词置信度,支持 10 个语言组的 170 种语言。官方报告其在人类盲评中的平均胜率为 72%,OlmOCRBench 得分为 85.20,同时说明自动基准存在标注与格式匹配局限,竞品分数来自内部复现。

    推荐理由:边界框、块类型和置信度让文档提取结果能同时用于定位引用与安排人工核验,为检索和智能体流程提供更明确的输入结构。

6月22日周一
6月16日周二
  1. Google DeepMind61

    Google DeepMind 如何通过 AI Control Roadmap 保障 AI 智能体安全

    Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。

    推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。

6月15日周一
  1. Import AI56

    Import AI 461:Sequent 寻求更可靠的对齐,FrontierCode 与科研实习生基准检验智能体

    非营利研究组织 Sequent 成立,认为对齐研究未必能赶上超级智能的发展,计划以多条并行研究路线提高安全信心,初期筹资目标为 $100–150M。Cognition 的 FrontierCode 包含 150 项编码任务,强调代码可合并性,Claude Opus 4.8 在最难的 Diamond 部分得分为 13.4%,文中另补充 Claude Fable 已达约 30%。

6月10日周三
6月9日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 12B:统一、无编码器的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用统一的无编码器架构,将视觉与音频输入直接接入 LLM 主干,面向笔记本本地多模态智能体应用。官方称其标准基准表现接近 26B MoE 模型,总内存占用不到后者一半,可在配备 16GB 显存或统一内存的设备上运行,并配备 Multi-Token Prediction(MTP)草稿模型以降低延迟。

    推荐理由:无独立编码器的音视频处理路径与本地内存要求,为评估多模态智能体从大模型迁移到笔记本的资源取舍提供了具体参照。

6月8日周一
6月5日周五
5月29日周五
  1. Google Research61

    Google Research 回顾 I/O 2026:AI 科研工具、健康研究与智能体开发进展

    Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。

    推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。

5月28日周四
  1. Mistral AI56

    Mistral 在 AI Now Summit 2026 展示工业工程 AI 栈、Vibe 更新与数据中心计划

    Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。

  2. Mistral AI80

    Mistral 将 Le Chat 升级为 Vibe,统一办公与编码智能体

    Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。

    推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。