跳到正文

#Agent

今日 28 条
5月28日周四
  1. Mistral AI59

    Mistral AI 发布开源 Search Toolkit 公共预览版,整合搜索管线

    Mistral AI 今天发布 Search Toolkit 公共预览版,以统一接口整合 AI 应用搜索管线的数据摄取、检索与评估,开源并支持云端、本地和边缘部署。框架支持文档解析、分块、嵌入向量生成,以及 BM25、稠密向量和混合检索,内置召回率、精确率、MRR 和 NDCG 指标,可独立衡量检索器表现。入门应用模板提供预配置的 Vespa 索引、混合检索和示例数据摄取管线。

5月26日周二
  1. Import AI70

    Jack Clark 谈如何面对 AI 持续进步,并以小说构想积极的奇点未来

    Anthropic 联合创始人 Jack Clark 在牛津演讲中主张为 AI 持续进步做好准备,并以个人实践和公司变化说明其对工作与社会的影响。他称 Opus 4.6 推动部分同事从编写代码转向管理和检查模型产出,公司也加大了代码测试与智能体可观测性工具的投入。文中将 AI 开发自身后继系统明确作为未来预测,并附上一篇以 AI 推动医疗进步、治愈休眠病童为情节的虚构故事,探索积极的奇点前景。

5月23日周六
  1. Mistral AI54

    Mistral AI 签署收购 Emmi AI 的最终协议,加速工业 AI 布局

    Mistral AI 本周签署收购物理 AI 公司 Emmi AI 的最终协议,旨在增强物理建模能力并推进面向工程师的 AI 智能体。Emmi AI 创立于奥地利,其模型支持实时仿真和数字孪生,可将耗时多日的计算替换为实时仿真。其联合创始人与超过 30 名研究人员及工程师将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队。

5月22日周五
5月18日周一
  1. Import AI51

    Import AI 457:计算破坏病毒的 AI 启示、Muon 优化器缺陷与正向对齐

    Import AI 本期汇总了 fast16.sys 篡改精密计算软件的调查、Muon 优化器导致神经元失活的研究,以及推动人类福祉的正向对齐主张。Tilde Research 报告称,Muon 在训练第 500 步时已有超过四分之一的神经元实际失活,其提出的 Aurora 在小规模实验中降低了损失,MMLU 得分较 Muon 提高 10 分。

5月17日周日
5月16日周六
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 3.5 系列,率先开放面向智能体与编码的 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,率先开放 3.5 Flash,面向复杂、长流程的智能体与编码任务。官方称其在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出 token 速度为其他前沿模型的 4 倍。

    推荐理由:官方将智能体与编码基准表现同输出速度、成本放在一起比较,为评估长流程任务中的性能与延迟取舍提供了具体参照。

5月12日周二
  1. Google DeepMind68

    Co-Scientist:基于 Gemini 的多智能体科研伙伴,协作生成与完善科学假设

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。

    推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。

5月6日周三
  1. Google DeepMind74

    AlphaEvolve 如何将 Gemini 驱动的编码智能体应用扩展至科研、基础设施与商业领域

    Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。

    推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。

5月4日周一
  1. Import AI65

    Jack Clark 分析 AI 自主研发前景,预计 2028 年底前实现的概率约为 60%

    Jack Clark 预计,到 2028 年底,前沿模型自主训练其后继版本、实现无人参与 AI 研发的概率约为 60%,2027 年实现的概率为 30%。他综合编码、长时任务、论文复现、模型后训练和多智能体管理等进展,判断 AI 已能自动化大量研发工程工作,但研究所需的创造力与突破性洞见仍是关键不确定因素。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 探索以 AI co-clinician 支持医生监督下的医疗协作

    Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。

    推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。

4月27日周一
  1. Mistral AI64

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版

    Mistral AI 发布 Workflows 公开预览版,作为 Studio 内的企业 AI 编排层,提供持久执行、可观测性、容错和人工审批能力。开发者用 Python 编写流程,可发布到 Le Chat 供业务团队触发,并在 Studio 中追踪审计;货物放行、文档合规检查和客服分流已有生产应用。

    推荐理由:通过暂停审批、故障续跑和执行追踪的业务案例,具体呈现企业把 AI 流程从原型搬到生产时需要补齐的编排能力。

4月22日周三
4月21日周二
  1. Google DeepMind43

    Google DeepMind 携手行业领军企业,加速 AI 转型

    Google DeepMind 与埃森哲、贝恩、BCG、德勤和麦肯锡合作,帮助企业规模化采用前沿 AI。合作伙伴将提前获得 Gemini 系列等前沿模型的访问权限,并直接与技术团队协作,开发行业专用 AI 解决方案。合作还将连接其领导层与客户 CEO 及董事会,帮助企业规划前沿 AI 的应用。

4月16日周四
  1. Google Research49

    Google Research 的 Simula 如何从第一性原理出发,以机制设计构建真实场景合成数据集

    Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。

4月9日周四
  1. Google Research50

    ConvApparel:衡量并缩小用户模拟器的真实性差距

    Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。

4月3日周五
3月31日周二
3月24日周二
  1. Mistral AI73

    Mistral 发布 Voxtral TTS:4B 参数语音生成模型,支持 9 种语言

    Mistral 发布文本转语音模型 Voxtral TTS,以 4B 参数支持 9 种语言的情感表达语音生成及零样本跨语言声音适配。官方称,在输入 10 秒声音样本和 500 个字符的典型条件下,模型延迟为 70ms;其人类评估显示,自然度优于 ElevenLabs Flash v2.5,音频质量与 ElevenLabs v3 相当。

    推荐理由:原文将语音自然度的人类评估与具体输入条件下的延迟并列呈现,为企业权衡语音智能体的表达质量与响应速度提供了参考。

3月18日周三
  1. Mistral AI51

    Mistral AI 推出 Forge,支持企业用自有知识训练定制模型

    Mistral AI 推出 Forge,让企业基于专有数据构建并持续改进模型,支持预训练、后训练和强化学习。系统支持稠密与 MoE 架构及多模态输入,企业可在自身基础设施环境中运行模型,并使用内部基准、合规规则和领域任务进行评估。Mistral Vibe 等自主智能体可借助 Forge 微调模型、寻找最优超参数、调度任务和生成合成数据,Forge 则负责基础设施并监控相关基准是否出现性能退化。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,整合推理、多模态与智能体编码能力

    Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。

    推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。

3月11日周三
1月28日周三
  1. Mistral AI69

    Mistral Vibe 2.0 发布,新增自定义子智能体与斜杠命令技能

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式及自动更新。

    推荐理由:自定义子智能体、执行前澄清与权限模式组合,为团队把终端编码自动化适配到具体任务和既有工作流程提供了可配置路径。

12月9日周二
10月24日周五
7月30日周三
7月17日周四
  1. Mistral AI71

    Mistral AI 更新 Le Chat,新增深度研究、语音模式与项目空间

    Mistral AI 为 Le Chat 新增 Deep Research 预览模式、语音模式、原生多语言推理、Projects 和高级图像编辑。Deep Research 可规划任务、澄清需求、搜索并生成带引用的结构化报告;语音模式由 Voxtral 支持,多语言推理由 Magistral 驱动。

    推荐理由:项目空间能保留文件、工具与设置,为需要持续研究和多轮交流的工作提供上下文组织方式,减少跨会话整理材料的负担。

7月11日周五
6月4日周三
5月27日周二
  1. Mistral AI72

    使用 Mistral Agents API 构建 AI 智能体

    Mistral 宣布推出 Agents API,整合内置连接器、MCP 工具、持久记忆与多智能体编排,补充现有 Chat Completion API。

    推荐理由:将内置工具、有状态对话与多智能体任务交接纳入同一接口,为企业搭建需要保留上下文并协调多步操作的工作流提供了具体参考。

5月21日周三
  1. Mistral AI75

    Mistral AI 发布开源编码智能体模型 Devstral,SWE-Bench Verified 得分 46.8%

    Mistral AI 与 All Hands AI 合作推出软件工程智能体模型 Devstral,以 Apache 2.0 许可开放,定位为研究预览。模型针对真实 GitHub 问题训练,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 模型高出超过 6 个百分点,可通过 OpenHands 或 SWE-Agent 等框架处理代码库任务。

    推荐理由:同一智能体框架下的基准比较结合单卡运行条件,为评估开源编码模型在本地代码库中的部署取舍提供了具体参照。

5月7日周三
3月4日周二