智能体成功一次后还能重复成功吗?ALTK-Evolve 用一致性指南缩小差距
ALTK-Evolve 新增 Consistency Analyzer 和一致性指南生成能力,在 AppWorld 测试中将 GPT-4.1 智能体的一致性差距从 24.4pp 缩小至 12.0pp。
推荐理由:通过区分平均成功率与多次运行全部成功的任务比例,这篇材料提供了衡量智能体重复执行可靠性的具体方法。
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
ALTK-Evolve 新增 Consistency Analyzer 和一致性指南生成能力,在 AppWorld 测试中将 GPT-4.1 智能体的一致性差距从 24.4pp 缩小至 12.0pp。
推荐理由:通过区分平均成功率与多次运行全部成功的任务比例,这篇材料提供了衡量智能体重复执行可靠性的具体方法。
Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。
推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。