跳到正文

#论文/研究

今日 1 条
7月8日周三
7月1日周三
  1. Hugging Face Blog58

    ScarfBench:评测 AI 智能体的企业 Java 框架迁移能力

    ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。

6月30日周二
6月27日周六
6月25日周四
6月17日周三
  1. Google Research41

    从像素到规划:Google Earth AI 助力自然修复

    Google 发布基于 Earth AI 的矢量化数据集,将英格兰树篱、石墙和小树林的像素地图转化为可用于自然修复规划的生态清单。团队微调 RSF 视觉模型,并结合双层标注、跨网格几何合并与形状分类,识别标准卫星检测容易遗漏的细小生态特征,为土地管理者提供测量和扩展这些特征的数据支持。

6月16日周二
  1. Google DeepMind61

    Google DeepMind 如何通过 AI Control Roadmap 保障 AI 智能体安全

    Google DeepMind 介绍 AI Control Roadmap,为 Google 内部部署的 AI 智能体建立模型对齐之外的系统级纵深防护。框架基于 MITRE ATT&CK 进行威胁建模,以覆盖率、召回率和响应时间衡量监控效果,并按模型逃避检测与执行攻击的能力配置检测及预防响应级别。

    推荐理由:将智能体视作潜在内部威胁,并按逃避检测与执行攻击的能力分级配置防护,为不完全依赖模型对齐的系统安全提供参考。

6月13日周六
  1. Google Research63

    Google Research 研究 AI 如何帮助用户理解皮肤问题及其决策局限

    Google Research 分享的研究发现,AI 辅助能提高用户识别皮肤问题的准确率,但未显著改善标准 AI 组选择后续医疗步骤的准确率。本周发表于 JAMA Dermatology 的研究纳入 2,345 名参与者,AI 组病症名称猜测准确率为 23%,对照组为 8%;AI 组建议的处理紧迫程度低于皮肤科医生判断的比例为 30%,对照组为 27%。

    推荐理由:研究区分了识别皮肤问题与选择就医步骤两种能力,为理解医疗信息工具的准确率提升为何不等于决策改善提供了具体对照。

6月11日周四
6月8日周一
6月5日周五
  1. Google Research70

    Google Research 探索用手机摄像头被动监测心脏健康

    Google Research 在 Nature 发表 PHRM 研究,利用面部解锁后的 8 秒前置摄像头视频,通过深度学习估算心率并汇总每日静息心率。在真实生活验证中,经置信度筛选后的心率平均绝对百分比误差为 6.09%,每日静息心率相对 Fitbit Charge 6 的平均绝对误差为 4.39 bpm,但较深肤色组的心率测量成功率较低。

    推荐理由:研究将真实生活场景中的误差与不同肤色的测量成功率分开呈现,为评估手机健康监测的准确性与覆盖差异提供了参考。

5月29日周五
  1. Google Research61

    Google Research 回顾 I/O 2026:AI 科研工具、健康研究与智能体开发进展

    Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。

    推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。

5月27日周三
5月20日周三
  1. Google Research63

    Google ERA 研究发表于 Nature,支撑 Computational Discovery 科学计算工具

    Google 的科研工具 ERA 研究今天发表于 Nature,该工具利用 Gemini 编写和优化科学代码,在多个学科基准上达到专家水平。ERA 根据科学问题与成功指标检索文献、编写代码并评估结果,通过树搜索探索数千种方案;团队现有 8 篇稿件将其用于具体科学问题,包括提前最多 4 周预测美国各州呼吸道疾病住院人数。

    推荐理由:以科学问题和成功指标驱动文献检索、代码生成与实验评估的闭环,为将科研代码优化方法迁移到不同学科提供了具体参考。

5月19日周二
5月16日周六
  1. Google DeepMind68

    Co-Scientist 辅助寻找可用于治疗肝纤维化的既有药物

    斯坦福大学医学院 Gary Peltz 团队利用 Co-Scientist 筛选肝纤维化候选药物,其推荐的 3 种药物中有 2 种在活人类肝细胞实验中阻断纤维化并促进细胞再生。

    推荐理由:同一人类肝细胞实验平台对比了研究者与模型推荐的候选药物,为理解文献检索所得假设如何转化为实验结果提供了具体案例。

5月12日周二
  1. Google DeepMind68

    Co-Scientist:基于 Gemini 的多智能体科研伙伴,协作生成与完善科学假设

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。

    推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 探索以 AI co-clinician 支持医生监督下的医疗协作

    Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。

    推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。

  2. Google Research65

    Google Research 科学家如何将 ERA 用于四类科学研究

    Google Research 展示了 Empirical Research Assistance(ERA)在公共卫生预测、宇宙学、二氧化碳监测和神经回路研究中的应用成果。

    推荐理由:四个案例展示了将结构信息、物理约束和既有观测数据引入科研建模的不同路径,为理解预测能力如何延伸到机制解释提供参照。

4月22日周三
4月20日周一
4月16日周四
  1. Google Research49

    Google Research 的 Simula 如何从第一性原理出发,以机制设计构建真实场景合成数据集

    Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。

4月14日周二
  1. Google Research61

    Google Research 探索用 Vantage 生成式 AI 模拟环境评估面向未来的技能

    Google Research 与纽约大学合作开发研究实验 Vantage,通过 AI 模拟团队对话评估学生面向未来的技能,英文版现已在 Google Labs 开放注册。

    推荐理由:通过主动引入冲突等情境来收集技能表现,再用同一量规评价对话,为难以标准化测量的协作能力提供了可借鉴的评估路径。

4月9日周四
  1. Google Research50

    ConvApparel:衡量并缩小用户模拟器的真实性差距

    Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。

4月3日周五
  1. Google Research62

    Google Research 评估 25 个 LLM 的行为倾向与人类偏好对齐程度

    Google Research 提出行为倾向评估框架,对 25 个 LLM 的分析发现,模型既会偏离人类共识,也未充分体现意见分歧。研究将心理问卷转化为现实情境判断测试,每个情境收集 10 名标注者的行动偏好,并与模型回答分布比较;在人类意见分歧较大的情境中,所有受测模型均表现出系统性过度自信。模型自报倾向与情境中的建议行为也存在差异,例如自称低冲动性,却给出偏向冲动的建议。

    推荐理由:将心理问卷转化为情境判断测试,为区分模型自述倾向与实际建议行为提供了可迁移的评估路径,而不只依赖自报答案。

4月1日周三
3月25日周三
3月18日周三
  1. Google Research71

    Google Research 研究如何用机器学习改善乳腺癌筛查流程

    Google Research 与 NHS 合作的两项 AIMS 研究显示,AI 独立阅片可提高乳腺癌检出能力,参与双阅片流程后的表现不劣于传统流程。发表于 Nature Cancer 的研究中,独立 AI 的癌症检出率从每 1,000 名女性 7.54 例提高至 9.33 例;以 AI 担任第二阅片者的研究估计可减少 46% 的人工阅片次数及 36–44% 的阅片时间。

    推荐理由:两项研究区分了模型独立检出能力与人机协作后的实际表现,为评估医疗人工智能提供了兼顾工作量和仲裁误判的视角。

3月17日周二
  1. Google Research46

    Google Research 评测 LLM 回答超导研究问题的能力

    Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。

3月13日周五
3月12日周四
  1. Google Research71

    Google Research 推出 Groundsource,利用 Gemini 将新闻转为洪灾历史数据

    Google Research 推出 Groundsource 方法,利用 Gemini 从新闻提取洪灾信息,并开放包含 2.6 million 条历史事件记录、覆盖超过 150 个国家的数据集。

    推荐理由:新闻记录可补充传统监测容易遗漏的局地短时洪灾,为历史数据稀缺地区的预测模型训练与验证提供另一类数据来源。