Google Research 的 SymptomAI 研究:面向日常症状评估的对话式 AI 智能体
Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。
推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。
Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。
推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。
Google Research 验证了强化学习量子控制框架,让 AI 智能体从量子错误检测中学习,在计算期间持续校准控制参数、抵消漂移。在 Willow 超导处理器上,人为注入漂移后,纠错码的逻辑稳定性提升至 3.5 倍;经专家充分校准后,强化学习微调仍将逻辑错误率进一步降低 20%。
Google Research 从数学机制解释扩散模型的创造力,指出训练中的正则化会平滑得分函数,使模型生成训练样本之间的新数据,而非仅复制样本。实验显示,权重衰减越强,学到的得分函数越平滑;即使没有显式正则化,基于梯度的训练也可能通过隐式正则化产生这一效果。
Hume 推出 Real World VoiceEQ 基准,评估超过 40 个闭源与开源语音模型在真实交互中的人类感知质量。基准基于超过 100 万次人类评分开发,覆盖 15+ 个评估维度和超过 60 项指标,涵盖语音识别、语音合成、语音到语音及语音理解。
推荐理由:将准确率、情绪理解与声音一致性分开评估,为语音系统选型提供了按场景比较的依据,而不是依赖单一总分。
Google Research 介绍传感器基础模型 SensorFM,通过无标签可穿戴数据预训练,学习可迁移至心血管、代谢、睡眠和心理健康任务的通用生理表征。训练数据来自 500 万名已同意参与研究的用户,超过 1 万亿分钟;模型采用自监督重建与 AIM 框架,直接从存在缺失的记录中学习。
Google Research 的实地研究表明,Google Maps 协调少量行程分流即可改善城市交通速度并降低排放。实验覆盖美国10座主要城市、持续六个月,不足2%的观测行程收到调整后的路线建议。目标路段车速增幅中位数约为2%,对应燃料消耗率降幅中位数为0.5%至1.0%。
ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。
Google Research 将建筑级屋顶反射率数据扩展至全球 9 个国家的 50+ 城市,支持城市规划者制定凉爽屋顶改造方案。数据通过新上线的 Heat Resilience Earth Engine App 公开提供,可交互查看并下载高分辨率数据,用于本地分析与政策制定。
DiScoFormer 可通过单次前向传播估计数据分布的密度与得分,切换分布无需重新训练。在 100 维测试中,相比手动调优的最佳 KDE,得分误差降低约 6.5x,密度误差降低超过 37x。模型还可利用无需标签的一致性损失,在推理时适应分布外输入。
NVIDIA 研究团队开发 ENPIRE,将编码智能体的实验与改进闭环用于实体机器人,研究报告称其可在部分灵巧操作任务上达到 99% 成功率。腾讯披露训练追踪与性能诊断系统 ARGUS,已在超过 10,000 张 GPU 的生产集群运行超过 6 个月,但机器人集群的资源利用与并行扩展仍是 ENPIRE 面临的工程挑战。
Google Research 为冻结权重的 Gemini Nano v3 加装多 token 预测(MTP)头,相关加速方案已部署至 Pixel 9 和 10 系列。
Google Research 的线性弹性缓存在 Spanner 生产环境中将内存使用量降低15.5%,总拥有成本降低约5%。该方法将缓存页面淘汰建模为滑雪租赁问题,用轻量级决策树预测页面存活时间,动态调整缓存大小。缓存未命中增加5.5%,但集中于读取成本较低的数据,实际 I/O 成本仅增加0.5%。
Google Research 的研究发现,链式推理可帮助大语言模型召回关闭推理时难以获取的简单事实,作用机制包括计算缓冲与事实启动。
推荐理由:研究将事实召回收益拆解为额外计算与相关事实启动两种机制,为理解简单问答为何也能受益于链式推理提供了实验依据。
Import AI 第 462 期汇总 AI 说服力、自我维持能力及 ASI 路径研究,其中说服实验覆盖 6,923 人的 18,978 次对话,AI 整体表现超过人类专家。
Google 发布基于 Earth AI 的矢量化数据集,将英格兰树篱、石墙和小树林的像素地图转化为可用于自然修复规划的生态清单。团队微调 RSF 视觉模型,并结合双层标注、跨网格几何合并与形状分类,识别标准卫星检测容易遗漏的细小生态特征,为土地管理者提供测量和扩展这些特征的数据支持。
Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。
推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。
Google Research 分享的研究发现,AI 辅助能提高用户识别皮肤问题的准确率,但未显著改善标准 AI 组选择后续医疗步骤的准确率。本周发表于 JAMA Dermatology 的研究纳入 2,345 名参与者,AI 组病症名称猜测准确率为 23%,对照组为 8%;AI 组建议的处理紧迫程度低于皮肤科医生判断的比例为 30%,对照组为 27%。
推荐理由:研究区分了识别皮肤问题与选择就医步骤两种能力,为理解医疗信息工具的准确率提升为何不等于决策改善提供了具体对照。
Google Research 提出 Regularized f-Divergence Kernel Tests 框架,通过相对距离检验判断遗忘后的模型更接近安全重训模型还是原始受污染模型。该框架自动选择散度与超参数;理论证明其可在任意样本量下控制误报,漏报风险随样本增加趋于零。
Google DeepMind 在塞拉利昂的预注册试验显示,使用 Gemini Guided Learning 的学生在八周内数学成绩较对照组提升了 +0.258 个标准差。
推荐理由:教师主导的课堂试验为引导式 AI 教学提供了量化依据,但数学基础更强的学生获益更多也提示了缩小学业差距的挑战。
SocioHack 研究用 72 个社会制度沙盒测试 AI 钻规则漏洞的能力,强化学习使模型在没有直接利用漏洞指令的情况下,以 61.25% 召回率和 90.85% 精确率重新发现历史漏洞。
Google Research 在 Nature 发表 PHRM 研究,利用面部解锁后的 8 秒前置摄像头视频,通过深度学习估算心率并汇总每日静息心率。在真实生活验证中,经置信度筛选后的心率平均绝对百分比误差为 6.09%,每日静息心率相对 Fitbit Charge 6 的平均绝对误差为 4.39 bpm,但较深肤色组的心率测量成功率较低。
推荐理由:研究将真实生活场景中的误差与不同肤色的测量成功率分开呈现,为评估手机健康监测的准确性与覆盖差异提供了参考。
Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。
推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。
Mistral 在收购 Emmi AI 后加大基础 Physics AI 研究投入,面向航空航天、汽车、半导体和能源等行业。其 AB-UPT 可在单个 GPU 上处理含 9M 表面单元和 140M 体积单元的原始几何,无需重新划分网格;NeuralDEM 支持流化床反应器等工业过程的实时仿真。
Google 的科研工具 ERA 研究今天发表于 Nature,该工具利用 Gemini 编写和优化科学代码,在多个学科基准上达到专家水平。ERA 根据科学问题与成功指标检索文献、编写代码并评估结果,通过树搜索探索数千种方案;团队现有 8 篇稿件将其用于具体科学问题,包括提前最多 4 周预测美国各州呼吸道疾病住院人数。
推荐理由:以科学问题和成功指标驱动文献检索、代码生成与实验评估的闭环,为将科研代码优化方法迁移到不同学科提供了具体参考。
生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 利用 Co-Scientist 寻找逆转细胞衰老的遗传因素,并加速分析大规模遗传筛选结果。
Import AI 本期汇总了 fast16.sys 篡改精密计算软件的调查、Muon 优化器导致神经元失活的研究,以及推动人类福祉的正向对齐主张。Tilde Research 报告称,Muon 在训练第 500 步时已有超过四分之一的神经元实际失活,其提出的 Aurora 在小规模实验中降低了损失,MMLU 得分较 Muon 提高 10 分。
Calico Life Sciences 利用 Co-Scientist 整合衰老生物学研究,提出值得实验检验的新假设。在整合应激反应(ISR)研究中,团队借助它提出代谢调控 ISR 的假设并完善实验设计,实验已取得涉及 ISR 在健康与疾病中作用的新发现,结果计划发表。
爱丁堡大学 Filippo Menolascina 团队利用 Co-Scientist 研究代谢功能障碍相关脂肪性肝炎(MASH),提出了后来获实验验证的机制假说。
推荐理由:案例展示了从跨领域文献综合到实验检验的研究路径,为利用 AI 缩小组合疗法搜索范围提供了具体参考。
斯坦福大学医学院 Gary Peltz 团队利用 Co-Scientist 筛选肝纤维化候选药物,其推荐的 3 种药物中有 2 种在活人类肝细胞实验中阻断纤维化并促进细胞再生。
推荐理由:同一人类肝细胞实验平台对比了研究者与模型推荐的候选药物,为理解文献检索所得假设如何转化为实验结果提供了具体案例。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。
推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。
Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。
推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。
Google Research 展示了 Empirical Research Assistance(ERA)在公共卫生预测、宇宙学、二氧化碳监测和神经回路研究中的应用成果。
推荐理由:四个案例展示了将结构信息、物理约束和既有观测数据引入科研建模的不同路径,为理解预测能力如何延伸到机制解释提供参照。
Google DeepMind 在新论文中提出 Decoupled DiLoCo,通过计算集群间的异步数据流隔离局部故障,实现低带宽跨数据中心训练。团队使用 2-5 Gbps 广域网络,在美国 4 个区域完成了一个 12 billion 参数模型的训练,速度比传统同步方法快 20 倍以上。
Google Research 在 ICLR 论文中介绍 ReasoningBank,将智能体的成功与失败经验提炼为结构化推理记忆,以支持测试时自我演进。
GRASP 是面向已学习世界模型的梯度规划器,通过改造优化过程,让长时域规划更具实用性与鲁棒性。它引入虚拟状态以跨时间并行优化,在状态迭代中加入随机性以促进探索,并重塑梯度,让动作获得清晰信号,避免高维视觉模型中脆弱的状态输入梯度。
Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。
Google Research 利用 MoGen 生成合成神经元形态,将 PATHFINDER 的神经元重建错误率降低了 4.4%。训练数据中加入 10% 的模拟数据后,改善主要来自错误合并减少;按完整小鼠脑规模估算,可节省相当于一名专家 157 年的人工校对工作。MoGen 已作为开源模型发布。
Google Research 与纽约大学合作开发研究实验 Vantage,通过 AI 模拟团队对话评估学生面向未来的技能,英文版现已在 Google Labs 开放注册。
推荐理由:通过主动引入冲突等情境来收集技能表现,再用同一量规评价对话,为难以标准化测量的协作能力提供了可借鉴的评估路径。
Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。
Google Research 推出 PaperVizAgent 和 ScholarPeer,分别用于生成学术图表和自动评审论文。PaperVizAgent 在经人类图表校准的 LLM 评测中总分为 60.2,超过设定的人工基线 50.0。ScholarPeer 结合网络文献检索与技术主张核验,在并排评测中优于先进自动评审方案。