Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将图像去噪重构为连续控制问题,统一生成引导与微调方法。其轻量附加网络在冻结基础模型时改善人类偏好匹配,允许修改内部权重的微调版本相对基线取得 90% 胜率。实验采用 Stable Diffusion v1.4,以 HPS-v2 评估表现。
Google Research 提出 Diffusion Controller,将图像去噪重构为连续控制问题,统一生成引导与微调方法。其轻量附加网络在冻结基础模型时改善人类偏好匹配,允许修改内部权重的微调版本相对基线取得 90% 胜率。实验采用 Stable Diffusion v1.4,以 HPS-v2 评估表现。
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
OpenAI 提出前沿 AI 训练安全论证的早期指南,涵盖技术防护措施、运营实践和不对齐事件调查。指南聚焦训练阶段的安全论证,仍处于早期阶段。
慕尼黑 CESifo 的一份新工作论文未发现证据表明,应届大学毕业生遭遇了显著、广泛的岗位替代或招聘减少,无论按绝对还是相对水平衡量。Robert Fairlie 和 Jane Wu 聚焦应届毕业生,是因为 AI 对劳动需求的影响可能先表现为减少入门岗位招聘,而非裁减资深员工;这一结论与上月报道的斯坦福大学研究形成对照,后者发现受 AI 影响职业的入门岗位就业落后于其他领域。
Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。
推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。
Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。
英国 AI 安全研究所(AISI)正使用 EvalEval 基础设施公开评测结果,以支持更可复现、可验证的评测。公开数据通过 Evaluation Cards 提供,包含已核验结果、背景及配置信息,覆盖主实验的 5 项基准和 6 款前沿模型,便于研究者比较不同评测设置下的表现。
Google Research 推出 C++ 实例生成器 MilleMiglia,为中段物流配送问题生成逼真且保护隐私的基准数据。它旨在弥补该领域公共高质量数据的缺口,支持配送中心间货物流转的优化研究。源代码和文档已在 GitHub 上公开。
Google Research 的 Retrieve-for-Train 框架将离线强化学习探索结果转化为监督数据,实现无需思考 token 的单次查询展开。其 53.9M 参数扩散模型以非自回归方式将查询嵌入向量映射为目标向量集合,训练无需人工标签,并以集合级奖励优化结果多样性与互补性。
Google Research 的 ToolGrad 利用文本“梯度”,先生成工具调用链再标注用户查询,以更低成本生成更复杂的工具使用数据。经 ToolGrad-500 微调的 ToolGrad-12B 在 BFCL 获得 83.1 分,接近 gemini-2.5-pro 的 83.2 分。
Google Research 评估欧洲人群数据向日本人群的多基因风险评分迁移,发现混合训练的收益随目标人群样本增多而下降。研究覆盖八项临床性状,目标样本仅 5,000 时,加入欧洲数据有助于预测。跨人群遗传相关性较高的性状可在更大目标样本规模下保留收益,血脂和血糖的收益则较小。
Google Research 与 HHMI Janelia 等合作者公布完整雄性果蝇大脑及中枢神经系统连接图,涵盖超过 166,000 个神经元和 125 million 个突触连接。
推荐理由:雄性与雌性果蝇连接组为比较性别差异及个体变异提供了基础,纳入腹神经索还让研究延伸到大脑如何控制身体。
BenchMIRT 用多维项目反应理论分析基准中的单道题目,从 100 个 LLM、16 个基准及超过 34K 道题的结果中识别出安全与通用推理两个主要维度。研究发现 BBQ 与通用推理的关联更强,保留 10% 的题目通常仍能近似呈现完整题集反映的能力强弱,预测未观测题目答对与否的准确率为 79%,简单基线为 70%。
Google 与 NASA JPL 合作的 MAPL-EMIT 研究发表于 PNAS,利用卫星高光谱数据检测甲烷羽流,对专家标注羽流的召回率为 84%。该框架以 3.6 million 个合成羽流训练,结合光谱与空间上下文量化甲烷增量、划分羽流边界并定位排放源,在约 1100 个 EMIT 数据颗粒中识别出约 50% 更多的可能羽流,但复杂地形中的误报仍是挑战。
Voice Arena 与 Hugging Face 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测,印地语成为榜单首个全球南方语言。评测集包含公开与私有划分,覆盖互不重叠的 4,888 名说话者,每人记录 12 项属性,以支持分析不同人群的识别差异。
Google DeepMind 推出全球首次针对闭源前沿 AI 模型的双盲评测试点,在加密安全环境中测试 Gemini Flash Lite。试点联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,使用保密基准,防止测试内容被模型用于后续测试前的性能优化,提高评测可信度。
Google Research 推出研究原型 AgentHands,让 AI 智能体在 XR 中生成与语音同步、贴合用户物理环境的手势。系统将 LLM 回答中的手势事件绑定到触发词,通过词级时间戳协调语音与动画。研究以 12 名参与者对比纯语音基线,结果显示空间指代效果显著改善。
Quantization-Aware Healing(QAH)使压缩至 60B 的 GPT-OSS 120B 模型在量化为 MXFP4 后,在 9 项基准中的 7 项超越同架构的 bfloat16 恢复版本。QAH 直接从压缩前的原始模型蒸馏,而非从恢复后的检查点蒸馏,避免受后者精度上限约束。
Google Research 推出 Biomarker Discovery Framework,通过人类监督下的多智能体研究循环,筛选可穿戴传感器数据中的候选生物标志物。系统结合统计分析、模型训练和对抗验证,在心理健康与代谢疾病队列中识别候选关联;结果不代表因果证据或已获临床验证。
Google Research 提出 ME-POIs 框架,将匿名聚合的流动模式融入文本地点表示,提升地点属性预测能力。结合先进文本模型后,访问意图预测相对提升最高达 81.9%,价格等级分类提升 75.1%,未见地点的繁忙程度估计准确率提升 24.7%。框架还利用周边地点的访问模式缓解数据稀疏问题。
Google Research 介绍研究原型 PhotoScan,从普通手机照片估算体脂率及脂肪分布指标,用于预测胰岛素抵抗风险。该框架以 35,323 名参与者的数据预训练、677 名成人的数据微调,并在 132 人的独立队列中验证。
推荐理由:研究将手机照片估算的脂肪分布指标与智能手表及临床扫描对照,展示了体脂率之外的信息对胰岛素抵抗风险识别的价值。
MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。
Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。
推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。
Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。
推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。
Google Research 提出 Chain-of-Evidence(CoE)框架,并以 Science One Framework 研究原型将科研主张绑定到引用、代码和实验记录。
推荐理由:将主张与证据的绑定前置到研究生成过程,而非成稿后补查,为减少自动科研中的虚假引用和文码不一致提供了可迁移方法。
Microsoft Research 的 Echoverse 构建了 12 个计算机操作智能体训练环境,使 Qwen3.5-9B 在文中环境评测中的平均得分从 36.5% 提升至 67.1%,GPT-5.4 的参考得分为 80.7%。
IBM Research 基于 Berkeley Sky Lab 的 K-Search 扩展 MLX 后端,以结构化 CUDA-to-MLX 翻译层将内核优化知识迁移到 Apple Silicon。
ABBEL 通过监督自然语言信念状态的更新,改善大语言模型在长程交互中压缩上下文后的表现。在协作编程环境 CollabBench 中,相比不采用信念评分的摘要训练,基于重建的信念评分将与完整上下文模型的性能差距缩小约 50%,训练步数减少 50%。训练后,其峰值上下文 token 用量仍显著低于完整上下文模型。
Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。
推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。
Google Research 验证了强化学习量子控制框架,让 AI 智能体从量子错误检测中学习,在计算期间持续校准控制参数、抵消漂移。在 Willow 超导处理器上,人为注入漂移后,纠错码的逻辑稳定性提升至 3.5 倍;经专家充分校准后,强化学习微调仍将逻辑错误率进一步降低 20%。
Google Research 从数学机制解释扩散模型的创造力,指出训练中的正则化会平滑得分函数,使模型生成训练样本之间的新数据,而非仅复制样本。实验显示,权重衰减越强,学到的得分函数越平滑;即使没有显式正则化,基于梯度的训练也可能通过隐式正则化产生这一效果。
Google Research 介绍传感器基础模型 SensorFM,通过无标签可穿戴数据预训练,学习可迁移至心血管、代谢、睡眠和心理健康任务的通用生理表征。训练数据来自 500 万名已同意参与研究的用户,超过 1 万亿分钟;模型采用自监督重建与 AIM 框架,直接从存在缺失的记录中学习。
Google Research 的实地研究表明,Google Maps 协调少量行程分流即可改善城市交通速度并降低排放。实验覆盖美国10座主要城市、持续六个月,不足2%的观测行程收到调整后的路线建议。目标路段车速增幅中位数约为2%,对应燃料消耗率降幅中位数为0.5%至1.0%。
Google Research 将建筑级屋顶反射率数据扩展至全球 9 个国家的 50+ 城市,支持城市规划者制定凉爽屋顶改造方案。数据通过新上线的 Heat Resilience Earth Engine App 公开提供,可交互查看并下载高分辨率数据,用于本地分析与政策制定。
Google Research 的线性弹性缓存在 Spanner 生产环境中将内存使用量降低15.5%,总拥有成本降低约5%。该方法将缓存页面淘汰建模为滑雪租赁问题,用轻量级决策树预测页面存活时间,动态调整缓存大小。缓存未命中增加5.5%,但集中于读取成本较低的数据,实际 I/O 成本仅增加0.5%。
Google 发布基于 Earth AI 的矢量化数据集,将英格兰树篱、石墙和小树林的像素地图转化为可用于自然修复规划的生态清单。团队微调 RSF 视觉模型,并结合双层标注、跨网格几何合并与形状分类,识别标准卫星检测容易遗漏的细小生态特征,为土地管理者提供测量和扩展这些特征的数据支持。
GRASP 是面向已学习世界模型的梯度规划器,通过改造优化过程,让长时域规划更具实用性与鲁棒性。它引入虚拟状态以跨时间并行优化,在状态迭代中加入随机性以促进探索,并重塑梯度,让动作获得清晰信号,避免高维视觉模型中脆弱的状态输入梯度。
SPEX 与 ProxySPEX 利用稀疏恢复识别大语言模型中的关键交互作用,将可分析规模较以往方法提升数个数量级。ProxySPEX 进一步利用交互的层级结构,以约十分之一的消融次数达到 SPEX 的表现。情感分析测试中,SPEX 在输入扩展至数千个特征时仍保持较高归因忠实度。
Berkeley AI Research 研究团队提出基于信息量评估与优化成像系统的框架,设计效果可媲美先进端到端方法。该方法仅用含噪测量和噪声模型估计互信息,在彩色摄影、射电天文学、无透镜成像和显微成像中均能预测下游性能。优化设计所需内存和计算更少,无需设计任务专用解码器。