Berkeley AI Research·· 2025-11-01AI 评分48
不依赖 TD 学习的强化学习:分治价值学习方法解析
RL without TD learning
AI 导读
研究团队将分治价值学习扩展到复杂的目标条件强化学习任务,探索不依赖 TD 学习的离策略 RL 算法。该方法将轨迹拆分为两段并组合其价值,理论上可将 Bellman 递归次数降至对数级,缓解长时序任务中的误差累积,但如何选择最优子目标仍是实现难点。
来源:Berkeley AI Research · bair.berkeley.edu