广义优势估计
概述
Schulman (2016) 提出的优势函数估计方法,通过超参数 λ 在单步 TD 估计(低方差高偏差)和完整蒙特卡洛回报(高方差低偏差)之间平滑插值,是 PPO 和 A3C 等算法的标准技术。
关键内容
-
核心公式:
Â_t^GAE(γ,λ) = Σ_{l=0}^{∞} (γλ)^l δ_{t+l}其中 δ_t = r_t + γV(s_{t+1}) - V(s_t) 是TD误差。 -
λ 的直觉意义:
- λ=0:退化为单步 TD 误差,A_t ≈ δ_t。低方差,高偏差(依赖价值函数估计精度)
- λ=1:退化为完整 MC 回报减 V(s)。无偏,但方差高
-
λ ∈ (0,1):平滑插值,实践中常用 λ=0.95
-
与 TD(λ) 的关系:GAE 是 TD(λ) 在优势函数估计上的扩展,将 λ-加权的多步 TD 误差之和作为优势估计。
-
工程价值:GAE 解决了策略梯度方法中的核心挑战——高方差导致训练不稳定。PPO、TRPO 均采用 GAE 作为标准优势估计器。
-
实现细节:计算时从轨迹末尾向前递推:
Â_t = δ_t + γλ · Â_{t+1}在有限时域轨迹中,末尾 Â_T = δ_T(或 0)。
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图
- raw/assets/RL-Analysis/rl_04_reinforce_trpo_ppo — PPO 中 GAE 的完整公式与超参数分析