ALTK-Evolve 研究:AI 智能体究竟需要多少记忆?
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。
Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。