跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 1–8 条 · 共 9 条
9月25日周五
  1. Google Research60

    Google Research 如何用多智能体框架自动生成连贯长视频

    Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。

    推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。

9月24日周四
  1. NVIDIA Blog60

    NVIDIA 与 Google DeepMind 等如何通过开放病毒蛋白结构数据助力大流行防范

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放超过 2,800 种病毒的蛋白复合物三维结构预测数据,支持未来大流行防范研究。

    推荐理由:将病毒蛋白复合物预测结构按置信度开放共享,为研究者提出可实验检验的假设提供起点,也降低了资源有限团队获取结构数据的门槛。

9月4日周五
8月28日周五
  1. Google Research60

    Google 介绍 planetary prediction engine 研究:借助 Earth AI 自动完成地理空间建模

    Google 在 Earth AI 中介绍实验性研究系统 planetary prediction engine(PPE),可从自然语言查询自动完成地理空间数据发现、整理、模型训练与评估。

    推荐理由:研究将防止目标泄漏与过拟合的检查嵌入自动建模流程,为把智能体用于地理空间预测提供了可迁移的工程思路。

8月17日周一
  1. Google Research60

    Google Research 探索超越 BMI:用 PhotoScan 手机影像估算心血管代谢风险

    Google Research 介绍研究原型 PhotoScan,从普通手机照片估算体脂率及脂肪分布指标,用于预测胰岛素抵抗风险。该框架以 35,323 名参与者的数据预训练、677 名成人的数据微调,并在 132 人的独立队列中验证。

    推荐理由:研究将手机照片估算的脂肪分布指标与智能手表及临床扫描对照,展示了体脂率之外的信息对胰岛素抵抗风险识别的价值。

8月12日周三
  1. Google Research71

    Google Research 研究:回忆而非知识编码是大语言模型参数化事实性的瓶颈

    Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。

    推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。

  2. Google Research69

    Google Research 推进 AMIE 实时视听问诊研究,模拟评估达到专家级表现

    Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。

    推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。

7月31日周五