跳到正文
原文
Berkeley AI Research·· 2025-11-01精选AI 评分62

无需 TD 学习的强化学习:分治范式与 Transitive RL

RL without TD learning

AI 导读

Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。

推荐理由

提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。

来源:Berkeley AI Research · bair.berkeley.edu