Berkeley AI Research·· 2025-11-01AI 评分37
Berkeley AI Research 提出基于分治策略的无 TD 学习强化学习算法
RL without TD learning
AI 导读
Berkeley AI Research 团队提出一种不依赖时序差分(TD)学习的强化新范式,利用“分而治之”策略解决长视野任务中的误差累积难题。该算法在目标条件 RL 中首次实现规模化应用,通过递归分割轨迹将 Bellman 更新次数降至对数级,无需调节 n-step 超参数即可提升 off-policy RL 的可扩展性。
来源:Berkeley AI Research · bair.berkeley.edu