多步回报
概述
多步回报(Multi-step Returns / n-step Returns)是介于单步 TD 和蒙特卡洛回报之间的折中方案,用 n 步实际奖励加上第 n 步的自举(bootstrapping)价值估计替代单步 TD 目标。n 步目标减少了对精确 Q 值的依赖,加速梯度信号传播,是Rainbow中重要性排第二的组件,Rainbow 使用 n=3。
关键内容
- 单步 vs n步 vs 蒙特卡洛:
- 单步 TD(n=1):
y₁ = r_t + γ V(s_{t+1}),低方差,高偏差,传播慢 - n 步回报:
y_n = Σ_{k=0}^{n-1} γ^k r_{t+k} + γ^n V(s_{t+n}),方差/偏差权衡 -
蒙特卡洛(n=∞):无偏,高方差,不需要价值估计
-
偏差-方差权衡:n 越大,对当前价值估计误差依赖越小(减少偏差),但累积更多环境随机性(增加方差)。实践中 n=3~5 通常效果较好。
-
与 Rainbow 的协同:在训练初期价值估计尚不准确时,n 步回报减少了对精确 Q 值的依赖,提供更好的梯度信号,加速收敛。Rainbow 消融显示 Multi-step 重要性仅次于 PER。
-
实现注意:经验回放中需存储 n 步的轨迹片段;与 PER 结合时优先级计算基于 n 步 TD 误差(Rainbow 中改为 KL 散度);与 off-policy 方法结合需处理重要性采样修正(Rainbow 中 n=3 较小,近似 on-policy,忽略 IS 修正)。
-
超参数:Rainbow 中 n=3,折扣因子 γ^n=γ^3;n 选择需权衡偏差、方差与轨迹截断带来的复杂度。
来源
- rl_03_rainbow — Rainbow: Combining Improvements in Deep Reinforcement Learning (arXiv:1710.02298, AAAI 2018)