跳到正文

#Agent

今日 5 条
7月7日周二
  1. Berkeley AI Research53

    智能趋近免费之后,数据系统如何服务、承载并由 AI 智能体构建?

    Berkeley AI Research 的观点文章提出,推理成本趋近零将推动数据系统沿服务智能体、承载智能体群和由智能体构建三个方向演进。在文中引用的多智能体 text-to-SQL 实验中,80-90% 的子查询执行重复工作,为结果复用与近似查询提供了优化空间。作者结合自身研究,讨论了结构化纠错记忆、共享状态并发与故障处理,以及通过辅助验证智能体和正确性证明应对定制数据系统的规范缺漏问题。

7月6日周一
  1. Hugging Face Blog47

    Hugging Face Kernels 重大更新

    Hugging Face Kernels 完成重大更新,新增 Hub 内核仓库类型,强化安全机制并扩展框架支持。默认仅加载可信发布者的内核,已支持代码签名及手动验证,但加载时尚不验签。此次还重整 CLI,新增 Torch Stable ABI 与 Apache TVM FFI 支持,为跨框架内核和 AI 智能体开发奠定基础。

7月2日周四
7月1日周三
  1. Hugging Face Blog58

    ScarfBench:评测 AI 智能体的企业 Java 框架迁移能力

    ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。

6月25日周四
6月24日周三
  1. Mistral AI48

    Mistral AI 增强 Connectors 管控能力

    Mistral AI 为 Connectors 新增权限管控、多账户连接和故障诊断能力,提升企业平台连接的安全性。管理员可按组织、工作区及单个工具配置权限,带连接器权限范围的 API 密钥与多账户连接已正式可用。Connectors Debugger 和 Workflows 集成进入公开预览,Vibe Code 集成已正式可用。

6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4:支持 170 种语言,新增边界框、块分类与置信度

    Mistral 发布文档理解模型 Mistral OCR 4,在提取文本的同时返回边界框、块类型及逐页、逐词置信度,支持 10 个语言组的 170 种语言。官方报告其在人类盲评中的平均胜率为 72%,OlmOCRBench 得分为 85.20,同时说明自动基准存在标注与格式匹配局限,竞品分数来自内部复现。

    推荐理由:边界框、块类型和置信度让文档提取结果能同时用于定位引用与安排人工核验,为检索和智能体流程提供更明确的输入结构。

6月16日周二
  1. Google DeepMind61

    Google DeepMind 如何通过 AI Control Roadmap 保障 AI 智能体安全

    Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。

    推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。

6月10日周三
6月9日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 12B:统一、无编码器的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用统一的无编码器架构,将视觉与音频输入直接接入 LLM 主干,面向笔记本本地多模态智能体应用。官方称其标准基准表现接近 26B MoE 模型,总内存占用不到后者一半,可在配备 16GB 显存或统一内存的设备上运行,并配备 Multi-Token Prediction(MTP)草稿模型以降低延迟。

    推荐理由:无独立编码器的音视频处理路径与本地内存要求,为评估多模态智能体从大模型迁移到笔记本的资源取舍提供了具体参照。

6月5日周五
5月29日周五
  1. Google Research61

    Google Research 回顾 I/O 2026:AI 科研工具、健康研究与智能体开发进展

    Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。

    推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。

5月28日周四
  1. Mistral AI56

    Mistral 在 AI Now Summit 2026 展示工业工程 AI 栈、Vibe 更新与数据中心计划

    Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。

  2. Mistral AI80

    Mistral 将 Le Chat 升级为 Vibe,统一办公与编码智能体

    Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。

    推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。

  3. Mistral AI59

    Mistral AI 发布开源 Search Toolkit 公共预览版,整合搜索管线

    Mistral AI 今天发布 Search Toolkit 公共预览版,以统一接口整合 AI 应用搜索管线的数据摄取、检索与评估,开源并支持云端、本地和边缘部署。框架支持文档解析、分块、嵌入向量生成,以及 BM25、稠密向量和混合检索,内置召回率、精确率、MRR 和 NDCG 指标,可独立衡量检索器表现。入门应用模板提供预配置的 Vespa 索引、混合检索和示例数据摄取管线。

5月23日周六
  1. Mistral AI54

    Mistral AI 签署收购 Emmi AI 的最终协议,加速工业 AI 布局

    Mistral AI 本周签署收购物理 AI 公司 Emmi AI 的最终协议,旨在增强物理建模能力并推进面向工程师的 AI 智能体。Emmi AI 创立于奥地利,其模型支持实时仿真和数字孪生,可将耗时多日的计算替换为实时仿真。其联合创始人与超过 30 名研究人员及工程师将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队。

5月22日周五
5月17日周日
5月16日周六
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 3.5 系列,率先开放面向智能体与编码的 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,率先开放 3.5 Flash,面向复杂、长流程的智能体与编码任务。官方称其在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出 token 速度为其他前沿模型的 4 倍。

    推荐理由:官方将智能体与编码基准表现同输出速度、成本放在一起比较,为评估长流程任务中的性能与延迟取舍提供了具体参照。

5月12日周二
  1. Google DeepMind68

    Co-Scientist:基于 Gemini 的多智能体科研伙伴,协作生成与完善科学假设

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。

    推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。

5月6日周三
  1. Google DeepMind74

    AlphaEvolve 如何将 Gemini 驱动的编码智能体应用扩展至科研、基础设施与商业领域

    Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。

    推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 探索以 AI co-clinician 支持医生监督下的医疗协作

    Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。

    推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。

4月27日周一
  1. Mistral AI64

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版

    Mistral AI 发布 Workflows 公开预览版,作为 Studio 内的企业 AI 编排层,提供持久执行、可观测性、容错和人工审批能力。开发者用 Python 编写流程,可发布到 Le Chat 供业务团队触发,并在 Studio 中追踪审计;货物放行、文档合规检查和客服分流已有生产应用。

    推荐理由:通过暂停审批、故障续跑和执行追踪的业务案例,具体呈现企业把 AI 流程从原型搬到生产时需要补齐的编排能力。

4月22日周三
4月21日周二
  1. Google DeepMind43

    Google DeepMind 携手行业领军企业,加速 AI 转型

    Google DeepMind 与埃森哲、贝恩、BCG、德勤和麦肯锡合作,帮助企业规模化采用前沿 AI。合作伙伴将提前获得 Gemini 系列等前沿模型的访问权限,并直接与技术团队协作,开发行业专用 AI 解决方案。合作还将连接其领导层与客户 CEO 及董事会,帮助企业规划前沿 AI 的应用。

4月16日周四
  1. Google Research49

    Google Research 的 Simula 如何从第一性原理出发,以机制设计构建真实场景合成数据集

    Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。

4月9日周四
  1. Google Research50

    ConvApparel:衡量并缩小用户模拟器的真实性差距

    Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。

4月3日周五
3月31日周二
3月24日周二
  1. Mistral AI73

    Mistral 发布 Voxtral TTS:4B 参数语音生成模型,支持 9 种语言

    Mistral 发布文本转语音模型 Voxtral TTS,以 4B 参数支持 9 种语言的情感表达语音生成及零样本跨语言声音适配。官方称,在输入 10 秒声音样本和 500 个字符的典型条件下,模型延迟为 70ms;其人类评估显示,自然度优于 ElevenLabs Flash v2.5,音频质量与 ElevenLabs v3 相当。

    推荐理由:原文将语音自然度的人类评估与具体输入条件下的延迟并列呈现,为企业权衡语音智能体的表达质量与响应速度提供了参考。

3月18日周三
  1. Mistral AI51

    Mistral AI 推出 Forge,支持企业用自有知识训练定制模型

    Mistral AI 推出 Forge,让企业基于专有数据构建并持续改进模型,支持预训练、后训练和强化学习。系统支持稠密与 MoE 架构及多模态输入,企业可在自身基础设施环境中运行模型,并使用内部基准、合规规则和领域任务进行评估。Mistral Vibe 等自主智能体可借助 Forge 微调模型、寻找最优超参数、调度任务和生成合成数据,Forge 则负责基础设施并监控相关基准是否出现性能退化。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,整合推理、多模态与智能体编码能力

    Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。

    推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。

3月11日周三
1月28日周三
  1. Mistral AI69

    Mistral Vibe 2.0 发布,新增自定义子智能体与斜杠命令技能

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式及自动更新。

    推荐理由:自定义子智能体、执行前澄清与权限模式组合,为团队把终端编码自动化适配到具体任务和既有工作流程提供了可配置路径。