跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分48

不依赖 TD 学习的强化学习:分治价值学习方法解析

RL without TD learning

AI 导读

研究团队将分治价值学习扩展到复杂的目标条件强化学习任务,探索不依赖 TD 学习的离策略 RL 算法。该方法将轨迹拆分为两段并组合其价值,理论上可将 Bellman 递归次数降至对数级,缓解长时序任务中的误差累积,但如何选择最优子目标仍是实现难点。

来源:Berkeley AI Research · bair.berkeley.edu