英国 AISI 与 EvalEval 如何让基准测试结果可复现
英国 AI 安全研究所(AISI)正使用 EvalEval 基础设施公开评测结果,以支持更可复现、可验证的评测。公开数据通过 Evaluation Cards 提供,包含已核验结果、背景及配置信息,覆盖主实验的 5 项基准和 6 款前沿模型,便于研究者比较不同评测设置下的表现。
英国 AI 安全研究所(AISI)正使用 EvalEval 基础设施公开评测结果,以支持更可复现、可验证的评测。公开数据通过 Evaluation Cards 提供,包含已核验结果、背景及配置信息,覆盖主实验的 5 项基准和 6 款前沿模型,便于研究者比较不同评测设置下的表现。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年难题解答。材料包括解答文稿及使用 Lean 编写的形式化证明。
Quantization-Aware Healing(QAH)使压缩至 60B 的 GPT-OSS 120B 模型在量化为 MXFP4 后,在 9 项基准中的 7 项超越同架构的 bfloat16 恢复版本。QAH 直接从压缩前的原始模型蒸馏,而非从恢复后的检查点蒸馏,避免受后者精度上限约束。
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。
Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。
推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。
ALTK-Evolve 在内部 AppWorld 对比测试中,以更少的推理 token 达到或超过 ACE 的任务表现。使用 DeepSeek-V3.2 时,TGC 从 80.4 升至 89.3,每任务 token 从 634K 降至 263K。两者均从智能体历史轨迹积累经验,但前者按模型能力调整经验注入量,ACE 每步注入完整经验手册。
Google Research 的研究发现,链式推理可帮助大语言模型召回关闭推理时难以获取的简单事实,作用机制包括计算缓冲与事实启动。
推荐理由:研究将事实召回收益拆解为额外计算与相关事实启动两种机制,为理解简单问答为何也能受益于链式推理提供了实验依据。
Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。
推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。
Google Research 在 ICLR 论文中介绍 ReasoningBank,将智能体的成功与失败经验提炼为结构化推理记忆,以支持测试时自我演进。
Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。
Google Research 介绍向量压缩算法 TurboQuant,在 Gemma 和 Mistral 的测试中将 KV cache 量化至 3 bits,无需训练或微调且不损失模型准确率。
Google Research 与 Beth Israel Deaconess Medical Center 开展 AMIE 单中心前瞻性可行性研究,100 名成人患者在医生实时监督下完成诊前文字问诊,未触发安全停止。
推荐理由:研究将诊前问诊置于医生实时监督的真实流程中,并区分可行性与临床疗效,为理解医疗对话系统的评估边界提供具体参照。