Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习方差偏差理论

RL方差偏差权衡

概述

强化学习中方差与偏差的权衡是三大范式差异的核心张力:Monte-Carlo 方法(REINFORCE)无偏但方差极高;TD/Bootstrapping 方法(DQN)方差低但引入偏差;Actor-Critic 方法通过 GAE 在两者之间取得折中。方差排序(高→低):REINFORCE >> A3C ≈ PPO > SAC > DDPG ≈ TD3 > DQN。

关键内容

  1. 方差来源
  2. Monte-Carlo 回报(REINFORCE):对整条轨迹求和,若单步方差为 σ²,T 步轨迹方差为 T·σ²,随 episode 长度线性增长
  3. TD 更新(DQN):仅单步 Bootstrap,批采样噪声是唯一方差来源,方差最低
  4. 随机策略梯度(A3C/PPO):用 GAE 替代 MC 回报大幅降低方差,但随机采样仍引入方差

  5. 偏差来源

  6. 函数逼近误差:所有深度 RL 方法均有,神经网络无法完美拟合真实价值
  7. Bootstrapping 偏差:TD 方法用当前不准确的 Q 函数估计目标值,引入偏差
  8. 过估计偏差:max 操作(DQN)系统性高估 Q 值;Double DQN 通过分离选择与评估网络缓解
  9. 函数逼近 + Off-policy 组合:致命三角(Deadly Triad),DQN 的工程稳定化技术(目标网络+经验回放)是工程补丁而非理论保证

  10. 算法梯度估计对比

  11. REINFORCEĝ = (1/N) Σ_τ [ Σ_t ∇_θ log π_θ(a_t|s_t) · G_t ],MC 回报 G_t 高方差
  12. Actor-Critic(A3C/PPO):ĝ = (1/N) Σ_t [ ∇_θ log π_θ(a_t|s_t) · Â_t^GAE ],GAE 优势降方差
  13. DDPG/TD3(确定性):ĝ = (1/N) Σ_s [ ∇_θ μ_θ(s) · ∇_a Q_φ(s,a) ],无随机采样,链式法则
  14. SAC(随机+重参数化):ĝ = (1/N) Σ_{s,ε} [ ∇_θ(α log π_θ(ã|s) - Q_φ(s,ã)) ],重参数化消除采样方差

  15. 收敛理论保证对比

  16. Q-learning(表格):有限 MDP 收敛保证(Bellman 压缩算子)
  17. DQN:无理论保证,工程稳定化(目标网络+经验回放
  18. REINFORCE:局部最优收敛(策略梯度定理
  19. TRPO:单调改进保证(信赖域+KL 约束,前提:精确策略评估)
  20. PPO:近似收敛保证(Clip 近似约束)
  21. SAC:软 Q 迭代收敛(软贝尔曼压缩算子)
  22. DDPG/TD3:无保证(DPG 定理有限适用)

  23. 重参数化技巧:SAC 将随机策略 a~π(·|s) 改写为 a = tanh(μ(s) + σ(s)⊙ε),ε~N(0,I),使梯度可通过确定性函数传播,避免直接对采样操作求导,将方差从 MC 采样降至仅批次噪声级别。

来源

相关