跳到正文
Berkeley AI Research·· 2025-11-01AI 评分46

无需 TD 学习的强化学习:分治法实现长时程 off-policy RL

RL without TD learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

伯克利 AI 研究提出一种基于分治(divide and conquer)范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。

来源:Berkeley AI Research · bair.berkeley.edu