跳到正文

#论文/研究

今日 1 条
今天9月30日周三
9月29日周二
  1. Hugging Face Blog49

    不只核对事实,还要核对来源:ProvenanceGuard 对 MCP 智能体的来源感知核验

    ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。

9月26日周六
  1. Ars Technica · AI59

    CESifo 研究未发现 AI 已广泛挤压应届大学毕业生就业的证据

    慕尼黑 CESifo 的一份新工作论文未发现证据表明,应届大学毕业生遭遇了显著、广泛的岗位替代或招聘减少,无论按绝对还是相对水平衡量。Robert Fairlie 和 Jane Wu 聚焦应届毕业生,是因为 AI 对劳动需求的影响可能先表现为减少入门岗位招聘,而非裁减资深员工;这一结论与上月报道的斯坦福大学研究形成对照,后者发现受 AI 影响职业的入门岗位就业落后于其他领域。

9月25日周五
  1. Google Research60

    Google Research 如何用多智能体框架自动生成连贯长视频

    Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。

    推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。

9月24日周四
  1. Microsoft Research52

    Microsoft Research 研究机器人推理卸载,比较机载与边缘、云端计算

    Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。

9月19日周六
9月16日周三
9月11日周五
9月8日周二
9月4日周五
  1. Google Research49

    Google Research:利用迁移学习改善代表性不足人群的基因组预测

    Google Research 评估欧洲人群数据向日本人群的多基因风险评分迁移,发现混合训练的收益随目标人群样本增多而下降。研究覆盖八项临床性状,目标样本仅 5,000 时,加入欧洲数据有助于预测。跨人群遗传相关性较高的性状可在更大目标样本规模下保留收益,血脂和血糖的收益则较小。

9月2日周三
  1. Hugging Face Blog58

    BenchMIRT 研究:LLM 基准究竟在衡量什么?

    BenchMIRT 用多维项目反应理论分析基准中的单道题目,从 100 个 LLM、16 个基准及超过 34K 道题的结果中识别出安全与通用推理两个主要维度。研究发现 BBQ 与通用推理的关联更强,保留 10% 的题目通常仍能近似呈现完整题集反映的能力强弱,预测未观测题目答对与否的准确率为 79%,简单基线为 70%。

  2. Google Research56

    Google Research 解读 MAPL-EMIT 如何用深度学习绘制全球甲烷排放图

    Google 与 NASA JPL 合作的 MAPL-EMIT 研究发表于 PNAS,利用卫星高光谱数据检测甲烷羽流,对专家标注羽流的召回率为 84%。该框架以 3.6 million 个合成羽流训练,结合光谱与空间上下文量化甲烷增量、划分羽流边界并定位排放源,在约 1100 个 EMIT 数据颗粒中识别出约 50% 更多的可能羽流,但复杂地形中的误报仍是挑战。

8月26日周三
8月25日周二
8月22日周六
8月21日周五
  1. Google Research46

    ME-POIs 如何利用流动数据加深语言模型对地点的理解

    Google Research 提出 ME-POIs 框架,将匿名聚合的流动模式融入文本地点表示,提升地点属性预测能力。结合先进文本模型后,访问意图预测相对提升最高达 81.9%,价格等级分类提升 75.1%,未见地点的繁忙程度估计准确率提升 24.7%。框架还利用周边地点的访问模式缓解数据稀疏问题。

  2. Hugging Face Blog73

    Hugging Face 研究量化语音识别基准优化:部分高分模型复现错误参考转写

    Hugging Face 的研究对 11 个开源 ASR 模型开展三类测试,发现部分高分模型在音频与参考文本冲突时仍复现基准答案。在 LibriSpeech 上,部分基准表现较强的模型在约 30–40% 的样本中恢复了已被静音的数字,而若干模型在新采集音频上的这一现象减弱,提示基准相关声学线索可能影响转写。

    推荐理由:通过参考错误复现、数字静音和拼写切换三类探针,研究提供了区分真实转写能力与针对公开基准优化的可迁移评估方法。

8月19日周三
8月17日周一
  1. Google Research60

    Google Research 探索超越 BMI:用 PhotoScan 手机影像估算心血管代谢风险

    Google Research 介绍研究原型 PhotoScan,从普通手机照片估算体脂率及脂肪分布指标,用于预测胰岛素抵抗风险。该框架以 35,323 名参与者的数据预训练、677 名成人的数据微调,并在 132 人的独立队列中验证。

    推荐理由:研究将手机照片估算的脂肪分布指标与智能手表及临床扫描对照,展示了体脂率之外的信息对胰岛素抵抗风险识别的价值。

8月13日周四
  1. Hugging Face Blog78

    Hugging Face 从复现 2,226 篇 ICML 论文中学到了什么

    Hugging Face 与 alphaXiv 组织的 ICML 2026 论文复现挑战中,1,221 名社区成员在 19 天内借助编码智能体尝试复现 2,226 篇论文,发布 6,816 份 Trackio 实验日志。

    推荐理由:复现中既发现论文错误,也出现单位混淆造成的错误反驳,为智能体参与科研审查提供了人工追问与二次核验的可迁移方法。

  2. Microsoft Research46

    MindTopo 揭示视觉语言模型的空间推理能力

    MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。

8月12日周三
  1. Google Research71

    Google Research 研究:回忆而非知识编码是大语言模型参数化事实性的瓶颈

    Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。

    推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。

  2. Google Research69

    Google Research 推进 AMIE 实时视听问诊研究,模拟评估达到专家级表现

    Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。

    推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。

8月10日周一
  1. Hugging Face Blog49

    Hugging Face 解析如何降低知识蒸馏成本以支持规模化实验

    Hugging Face 展示离线缓存教师模型输出与融合分块 KL 损失如何降低知识蒸馏成本,让单 GPU 长上下文能力恢复训练成为可能。该方法缓存每个位置的 top-100 logits,训练时无需加载教师模型;融合分块计算避免构建完整词表与序列矩阵,示例中显存峰值从约 250GB 降至约 128GB。

7月31日周五
7月29日周三
7月26日周日
  1. Berkeley AI Research48

    ABBEL:教大语言模型更新信念,实现高效长程交互

    ABBEL 通过监督自然语言信念状态的更新,改善大语言模型在长程交互中压缩上下文后的表现。在协作编程环境 CollabBench 中,相比不采用信念评分的摘要训练,基于重建的信念评分将与完整上下文模型的性能差距缩小约 50%,训练步数减少 50%。训练后,其峰值上下文 token 用量仍显著低于完整上下文模型。

7月23日周四
  1. Google Research69

    Google Research 的 SymptomAI 研究:面向日常症状评估的对话式 AI 智能体

    Google Research 在 13,917 名参与者中随机比较了基于 Gemini Flash 2.0 的五种 SymptomAI 智能体,发现主动追问策略的鉴别诊断准确性显著优于未加提示词、由用户主导的基线。

    推荐理由:研究将主动追问与用户主导的问答进行对照,为症状评估智能体提供了通过补充患者信息改善鉴别诊断的设计思路。

  2. Google Research50

    Google Research 探索让量子计算机从错误中学习

    Google Research 验证了强化学习量子控制框架,让 AI 智能体从量子错误检测中学习,在计算期间持续校准控制参数、抵消漂移。在 Willow 超导处理器上,人为注入漂移后,纠错码的逻辑稳定性提升至 3.5 倍;经专家充分校准后,强化学习微调仍将逻辑错误率进一步降低 20%。

7月16日周四
7月15日周三
  1. Hugging Face Blog63

    Real World VoiceEQ 发布,以人类评价衡量语音 AI 的真实交互质量

    Hume 推出 Real World VoiceEQ 基准,评估超过 40 个闭源与开源语音模型在真实交互中的人类感知质量。基准基于超过 100 万次人类评分开发,覆盖 15+ 个评估维度和超过 60 项指标,涵盖语音识别、语音合成、语音到语音及语音理解。

    推荐理由:将准确率、情绪理解与声音一致性分开评估,为语音系统选型提供了按场景比较的依据,而不是依赖单一总分。

7月9日周四
7月8日周三
7月1日周三
  1. Hugging Face Blog58

    ScarfBench:评测 AI 智能体的企业 Java 框架迁移能力

    ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。

6月30日周二
6月25日周四