Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习TD学习蒙特卡洛DQN

多步回报

概述

多步回报(Multi-step Returns / n-step Returns)是介于单步 TD 和蒙特卡洛回报之间的折中方案,用 n 步实际奖励加上第 n 步的自举(bootstrapping)价值估计替代单步 TD 目标。n 步目标减少了对精确 Q 值的依赖,加速梯度信号传播,是Rainbow中重要性排第二的组件,Rainbow 使用 n=3。

关键内容

  1. 单步 vs n步 vs 蒙特卡洛
  2. 单步 TD(n=1):y₁ = r_t + γ V(s_{t+1}),低方差,高偏差,传播慢
  3. n 步回报:y_n = Σ_{k=0}^{n-1} γ^k r_{t+k} + γ^n V(s_{t+n}),方差/偏差权衡
  4. 蒙特卡洛(n=∞):无偏,高方差,不需要价值估计

  5. 偏差-方差权衡:n 越大,对当前价值估计误差依赖越小(减少偏差),但累积更多环境随机性(增加方差)。实践中 n=3~5 通常效果较好。

  6. Rainbow 的协同:在训练初期价值估计尚不准确时,n 步回报减少了对精确 Q 值的依赖,提供更好的梯度信号,加速收敛。Rainbow 消融显示 Multi-step 重要性仅次于 PER。

  7. 实现注意经验回放中需存储 n 步的轨迹片段;与 PER 结合时优先级计算基于 n 步 TD 误差(Rainbow 中改为 KL 散度);与 off-policy 方法结合需处理重要性采样修正(Rainbow 中 n=3 较小,近似 on-policy,忽略 IS 修正)。

  8. 超参数Rainbow 中 n=3,折扣因子 γ^n=γ^3;n 选择需权衡偏差、方差与轨迹截断带来的复杂度。

来源

相关