Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习数学

广义优势估计

概述

Schulman (2016) 提出的优势函数估计方法,通过超参数 λ 在单步 TD 估计(低方差高偏差)和完整蒙特卡洛回报(高方差低偏差)之间平滑插值,是 PPO 和 A3C 等算法的标准技术。

关键内容

  1. 核心公式Â_t^GAE(γ,λ) = Σ_{l=0}^{∞} (γλ)^l δ_{t+l} 其中 δ_t = r_t + γV(s_{t+1}) - V(s_t) 是TD误差

  2. λ 的直觉意义

  3. λ=0:退化为单步 TD 误差,A_t ≈ δ_t。低方差,高偏差(依赖价值函数估计精度)
  4. λ=1:退化为完整 MC 回报减 V(s)。无偏,但方差高
  5. λ ∈ (0,1):平滑插值,实践中常用 λ=0.95

  6. 与 TD(λ) 的关系:GAE 是 TD(λ) 在优势函数估计上的扩展,将 λ-加权的多步 TD 误差之和作为优势估计。

  7. 工程价值:GAE 解决了策略梯度方法中的核心挑战——高方差导致训练不稳定。PPO、TRPO 均采用 GAE 作为标准优势估计器。

  8. 实现细节计算时从轨迹末尾向前递推: Â_t = δ_t + γλ · Â_{t+1} 在有限时域轨迹中,末尾 Â_T = δ_T(或 0)。

来源

相关