Berkeley AI Research·2025-11-01 17:00· 2025-11-01AI 评分40不依赖 TD 学习的强化学习:分治法如何扩展到长时程任务RL without TD learningAI 导读Berkeley AI Research 提出一种基于分治范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。来源:Berkeley AI Research · bair.berkeley.edu推理能力数据与训练#研究/论文#领域:AI#推理#数据/训练#arXiv