Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将图像去噪重构为连续控制问题,统一生成引导与微调方法。其轻量附加网络在冻结基础模型时改善人类偏好匹配,允许修改内部权重的微调版本相对基线取得 90% 胜率。实验采用 Stable Diffusion v1.4,以 HPS-v2 评估表现。
Google Research 提出 Diffusion Controller,将图像去噪重构为连续控制问题,统一生成引导与微调方法。其轻量附加网络在冻结基础模型时改善人类偏好匹配,允许修改内部权重的微调版本相对基线取得 90% 胜率。实验采用 Stable Diffusion v1.4,以 HPS-v2 评估表现。
Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。
推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。
Google Research 推出 C++ 实例生成器 MilleMiglia,为中段物流配送问题生成逼真且保护隐私的基准数据。它旨在弥补该领域公共高质量数据的缺口,支持配送中心间货物流转的优化研究。源代码和文档已在 GitHub 上公开。
Google Research 的 Retrieve-for-Train 框架将离线强化学习探索结果转化为监督数据,实现无需思考 token 的单次查询展开。其 53.9M 参数扩散模型以非自回归方式将查询嵌入向量映射为目标向量集合,训练无需人工标签,并以集合级奖励优化结果多样性与互补性。
Google Research 的 ToolGrad 利用文本“梯度”,先生成工具调用链再标注用户查询,以更低成本生成更复杂的工具使用数据。经 ToolGrad-500 微调的 ToolGrad-12B 在 BFCL 获得 83.1 分,接近 gemini-2.5-pro 的 83.2 分。
Google Research 评估欧洲人群数据向日本人群的多基因风险评分迁移,发现混合训练的收益随目标人群样本增多而下降。研究覆盖八项临床性状,目标样本仅 5,000 时,加入欧洲数据有助于预测。跨人群遗传相关性较高的性状可在更大目标样本规模下保留收益,血脂和血糖的收益则较小。
Google Research 与 HHMI Janelia 等合作者公布完整雄性果蝇大脑及中枢神经系统连接图,涵盖超过 166,000 个神经元和 125 million 个突触连接。
推荐理由:雄性与雌性果蝇连接组为比较性别差异及个体变异提供了基础,纳入腹神经索还让研究延伸到大脑如何控制身体。
Google 与 NASA JPL 合作的 MAPL-EMIT 研究发表于 PNAS,利用卫星高光谱数据检测甲烷羽流,对专家标注羽流的召回率为 84%。该框架以 3.6 million 个合成羽流训练,结合光谱与空间上下文量化甲烷增量、划分羽流边界并定位排放源,在约 1100 个 EMIT 数据颗粒中识别出约 50% 更多的可能羽流,但复杂地形中的误报仍是挑战。
Google DeepMind 推出全球首次针对闭源前沿 AI 模型的双盲评测试点,在加密安全环境中测试 Gemini Flash Lite。试点联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,使用保密基准,防止测试内容被模型用于后续测试前的性能优化,提高评测可信度。
Google Research 推出研究原型 AgentHands,让 AI 智能体在 XR 中生成与语音同步、贴合用户物理环境的手势。系统将 LLM 回答中的手势事件绑定到触发词,通过词级时间戳协调语音与动画。研究以 12 名参与者对比纯语音基线,结果显示空间指代效果显著改善。
Google Research 推出 Biomarker Discovery Framework,通过人类监督下的多智能体研究循环,筛选可穿戴传感器数据中的候选生物标志物。系统结合统计分析、模型训练和对抗验证,在心理健康与代谢疾病队列中识别候选关联;结果不代表因果证据或已获临床验证。
Google Research 提出 ME-POIs 框架,将匿名聚合的流动模式融入文本地点表示,提升地点属性预测能力。结合先进文本模型后,访问意图预测相对提升最高达 81.9%,价格等级分类提升 75.1%,未见地点的繁忙程度估计准确率提升 24.7%。框架还利用周边地点的访问模式缓解数据稀疏问题。
Google Research 介绍研究原型 PhotoScan,从普通手机照片估算体脂率及脂肪分布指标,用于预测胰岛素抵抗风险。该框架以 35,323 名参与者的数据预训练、677 名成人的数据微调,并在 132 人的独立队列中验证。
推荐理由:研究将手机照片估算的脂肪分布指标与智能手表及临床扫描对照,展示了体脂率之外的信息对胰岛素抵抗风险识别的价值。
Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。
推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。
Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。
推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。
Google Research 提出 Chain-of-Evidence(CoE)框架,并以 Science One Framework 研究原型将科研主张绑定到引用、代码和实验记录。
推荐理由:将主张与证据的绑定前置到研究生成过程,而非成稿后补查,为减少自动科研中的虚假引用和文码不一致提供了可迁移方法。
Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。
推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。
Google Research 验证了强化学习量子控制框架,让 AI 智能体从量子错误检测中学习,在计算期间持续校准控制参数、抵消漂移。在 Willow 超导处理器上,人为注入漂移后,纠错码的逻辑稳定性提升至 3.5 倍;经专家充分校准后,强化学习微调仍将逻辑错误率进一步降低 20%。
Google Research 从数学机制解释扩散模型的创造力,指出训练中的正则化会平滑得分函数,使模型生成训练样本之间的新数据,而非仅复制样本。实验显示,权重衰减越强,学到的得分函数越平滑;即使没有显式正则化,基于梯度的训练也可能通过隐式正则化产生这一效果。
Google Research 介绍传感器基础模型 SensorFM,通过无标签可穿戴数据预训练,学习可迁移至心血管、代谢、睡眠和心理健康任务的通用生理表征。训练数据来自 500 万名已同意参与研究的用户,超过 1 万亿分钟;模型采用自监督重建与 AIM 框架,直接从存在缺失的记录中学习。
Google Research 的实地研究表明,Google Maps 协调少量行程分流即可改善城市交通速度并降低排放。实验覆盖美国10座主要城市、持续六个月,不足2%的观测行程收到调整后的路线建议。目标路段车速增幅中位数约为2%,对应燃料消耗率降幅中位数为0.5%至1.0%。
Google Research 将建筑级屋顶反射率数据扩展至全球 9 个国家的 50+ 城市,支持城市规划者制定凉爽屋顶改造方案。数据通过新上线的 Heat Resilience Earth Engine App 公开提供,可交互查看并下载高分辨率数据,用于本地分析与政策制定。
Google Research 的线性弹性缓存在 Spanner 生产环境中将内存使用量降低15.5%,总拥有成本降低约5%。该方法将缓存页面淘汰建模为滑雪租赁问题,用轻量级决策树预测页面存活时间,动态调整缓存大小。缓存未命中增加5.5%,但集中于读取成本较低的数据,实际 I/O 成本仅增加0.5%。
Google Research 的研究发现,链式推理可帮助大语言模型召回关闭推理时难以获取的简单事实,作用机制包括计算缓冲与事实启动。
推荐理由:研究将事实召回收益拆解为额外计算与相关事实启动两种机制,为理解简单问答为何也能受益于链式推理提供了实验依据。
Google 发布基于 Earth AI 的矢量化数据集,将英格兰树篱、石墙和小树林的像素地图转化为可用于自然修复规划的生态清单。团队微调 RSF 视觉模型,并结合双层标注、跨网格几何合并与形状分类,识别标准卫星检测容易遗漏的细小生态特征,为土地管理者提供测量和扩展这些特征的数据支持。
Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。
推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。
Google Research 分享的研究发现,AI 辅助能提高用户识别皮肤问题的准确率,但未显著改善标准 AI 组选择后续医疗步骤的准确率。本周发表于 JAMA Dermatology 的研究纳入 2,345 名参与者,AI 组病症名称猜测准确率为 23%,对照组为 8%;AI 组建议的处理紧迫程度低于皮肤科医生判断的比例为 30%,对照组为 27%。
推荐理由:研究区分了识别皮肤问题与选择就医步骤两种能力,为理解医疗信息工具的准确率提升为何不等于决策改善提供了具体对照。
Google Research 提出 Regularized f-Divergence Kernel Tests 框架,通过相对距离检验判断遗忘后的模型更接近安全重训模型还是原始受污染模型。该框架自动选择散度与超参数;理论证明其可在任意样本量下控制误报,漏报风险随样本增加趋于零。
Google DeepMind 在塞拉利昂的预注册试验显示,使用 Gemini Guided Learning 的学生在八周内数学成绩较对照组提升了 +0.258 个标准差。
推荐理由:教师主导的课堂试验为引导式 AI 教学提供了量化依据,但数学基础更强的学生获益更多也提示了缩小学业差距的挑战。
Google Research 在 Nature 发表 PHRM 研究,利用面部解锁后的 8 秒前置摄像头视频,通过深度学习估算心率并汇总每日静息心率。在真实生活验证中,经置信度筛选后的心率平均绝对百分比误差为 6.09%,每日静息心率相对 Fitbit Charge 6 的平均绝对误差为 4.39 bpm,但较深肤色组的心率测量成功率较低。
推荐理由:研究将真实生活场景中的误差与不同肤色的测量成功率分开呈现,为评估手机健康监测的准确性与覆盖差异提供了参考。
生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 利用 Co-Scientist 寻找逆转细胞衰老的遗传因素,并加速分析大规模遗传筛选结果。
爱丁堡大学 Filippo Menolascina 团队利用 Co-Scientist 研究代谢功能障碍相关脂肪性肝炎(MASH),提出了后来获实验验证的机制假说。
推荐理由:案例展示了从跨领域文献综合到实验检验的研究路径,为利用 AI 缩小组合疗法搜索范围提供了具体参考。
斯坦福大学医学院 Gary Peltz 团队利用 Co-Scientist 筛选肝纤维化候选药物,其推荐的 3 种药物中有 2 种在活人类肝细胞实验中阻断纤维化并促进细胞再生。
推荐理由:同一人类肝细胞实验平台对比了研究者与模型推荐的候选药物,为理解文献检索所得假设如何转化为实验结果提供了具体案例。
Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。
推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。
Google DeepMind 在新论文中提出 Decoupled DiLoCo,通过计算集群间的异步数据流隔离局部故障,实现低带宽跨数据中心训练。团队使用 2-5 Gbps 广域网络,在美国 4 个区域完成了一个 12 billion 参数模型的训练,速度比传统同步方法快 20 倍以上。
Google Research 在 ICLR 论文中介绍 ReasoningBank,将智能体的成功与失败经验提炼为结构化推理记忆,以支持测试时自我演进。
Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。
Google Research 利用 MoGen 生成合成神经元形态,将 PATHFINDER 的神经元重建错误率降低了 4.4%。训练数据中加入 10% 的模拟数据后,改善主要来自错误合并减少;按完整小鼠脑规模估算,可节省相当于一名专家 157 年的人工校对工作。MoGen 已作为开源模型发布。
Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。
Google Research 推出 PaperVizAgent 和 ScholarPeer,分别用于生成学术图表和自动评审论文。PaperVizAgent 在经人类图表校准的 LLM 评测中总分为 60.2,超过设定的人工基线 50.0。ScholarPeer 结合网络文献检索与技术主张核验,在并排评测中优于先进自动评审方案。