ALTK-Evolve 研究:AI 智能体究竟需要多少记忆?
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
ALTK-Evolve 在内部 AppWorld 对比测试中,以更少的推理 token 达到或超过 ACE 的任务表现。使用 DeepSeek-V3.2 时,TGC 从 80.4 升至 89.3,每任务 token 从 634K 降至 263K。两者均从智能体历史轨迹积累经验,但前者按模型能力调整经验注入量,ACE 每步注入完整经验手册。
Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。