Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别面向复杂智能体任务、高吞吐工作流和漏洞发现与修复。
推荐理由:同一系列按复杂任务、高吞吐和漏洞修复划分用途,并给出成本与访问边界,为生产智能体的模型选型提供了具体比较依据。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别面向复杂智能体任务、高吞吐工作流和漏洞发现与修复。
推荐理由:同一系列按复杂任务、高吞吐和漏洞修复划分用途,并给出成本与访问边界,为生产智能体的模型选型提供了具体比较依据。
Google 推出 Gemini 3.5 Flash Cyber,这款基于 3.5 Flash 微调的轻量网络安全模型专用于快速发现、验证和修复漏洞。在固定调用次数的 V8 测试中,该模型发现 55 个已确认的独特问题,主线 3.5 Flash 和 Claude Opus 4.6 分别发现 47 个和 36 个,其中 10 个问题未被另外两个模型发现。
推荐理由:轻量模型的低成本让安全智能体能够反复探索更多代码路径,为比较漏洞发现方案提供了单次模型能力之外的架构视角。
Mistral 发布 Leanstral 1.5,这款面向 Lean 4 证明工程的模型总参数为 119B、激活参数为 6B,以 Apache-2.0 许可开放权重并提供免费 API。
推荐理由:从数学竞赛题到真实代码缺陷,材料给出了形式化验证的成本对比与工程案例,便于判断证明模型进入开发流程的实用价值。
Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。
推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。
Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。
推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。
Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。
推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。
Mistral 发布公开预览版 Mistral Medium 3.5,并将其设为 Vibe 和 Le Chat 的默认模型,支持云端编码智能体与多步骤 Work mode。
推荐理由:本地会话连同任务状态和审批记录迁至云端的设计,为长任务异步执行与保留人工审查之间的衔接提供了具体参考。
Google 的科研工具 ERA 研究今天发表于 Nature,该工具利用 Gemini 编写和优化科学代码,在多个学科基准上达到专家水平。ERA 根据科学问题与成功指标检索文献、编写代码并评估结果,通过树搜索探索数千种方案;团队现有 8 篇稿件将其用于具体科学问题,包括提前最多 4 周预测美国各州呼吸道疾病住院人数。
推荐理由:以科学问题和成功指标驱动文献检索、代码生成与实验评估的闭环,为将科研代码优化方法迁移到不同学科提供了具体参考。
Google DeepMind 发布 Gemini 3.5 模型系列,率先开放 3.5 Flash,面向复杂、长流程的智能体与编码任务。官方称其在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出 token 速度为其他前沿模型的 4 倍。
推荐理由:官方将智能体与编码基准表现同输出速度、成本放在一起比较,为评估长流程任务中的性能与延迟取舍提供了具体参照。
Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。
推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。
Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。
推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库任务,以 Apache 2.0 许可开放权重,并接入 Mistral Vibe。
推荐理由:基于真实形式化仓库任务的评测同时列出得分与运行成本,为比较专用模型和通用编码智能体的证明工程取舍提供了依据。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式及自动更新。
推荐理由:自定义子智能体、执行前澄清与权限模式组合,为团队把终端编码自动化适配到具体任务和既有工作流程提供了可配置路径。
Mistral AI 发布 Devstral 2(123B)与 Devstral Small 2(24B)编码模型,并推出支持端到端代码自动化的开源助手 Mistral Vibe CLI。
推荐理由:两种规模模型的基准成绩、许可差异与硬件要求提供了具体选型依据,可用于权衡编码智能体的性能需求和本地部署条件。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和 Devstral Small 1.1,在 SWE-Bench Verified 上分别取得 61.6% 和 53.6% 的成绩。
推荐理由:两款模型给出了同一编码基准下的成绩与调用价格,并区分开放许可和私有部署路径,便于按预算与部署需求比较选型。
Mistral AI 与 All Hands AI 合作推出软件工程智能体模型 Devstral,以 Apache 2.0 许可开放,定位为研究预览。模型针对真实 GitHub 问题训练,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 模型高出超过 6 个百分点,可通过 OpenHands 或 SWE-Agent 等框架处理代码库任务。
推荐理由:同一智能体框架下的基准比较结合单卡运行条件,为评估开源编码模型在本地代码库中的部署取舍提供了具体参照。
Mistral AI 发布 Mistral Medium 3,面向编码、多模态理解等企业场景,支持混合部署、本地部署及 in-VPC 部署。官方称其各项基准表现达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并可在至少 4 个 GPU 的自托管环境中部署。
推荐理由:将基准表现、API 价格与自托管条件放在一起比较,为企业在模型能力、使用成本和部署方式之间取舍提供了具体参考。