Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习策略梯度算法RLHF

PPO

概述

Schulman et al. (OpenAI, 2017) 提出的近端策略优化算法。通过 Clip 目标函数近似 TRPO 的信赖域约束,在保留近似单调改进保证的同时实现一阶优化(普通 SGD/Adam),成为 2017-2023 年工业界最广泛使用的 RL 算法,也是 RLHF(InstructGPT/ChatGPT)的核心组件。

关键内容

  1. PPO-Clip 核心目标L^{CLIP}(θ) = E_t [ min(r_t(θ)·Â_t, clip(r_t(θ), 1-ε, 1+ε)·Â_t) ] r_t(θ) = π_θ/π_θ_old 为重要性采样比,ε=0.2。Clip 操作使梯度在比率超出 [1-ε, 1+ε] 时归零,天然限制更新幅度,无需二阶优化。

  2. 完整损失函数L^{PPO} = L^{CLIP} - c₁·L^{VF} + c₂·S[π] 三项分别为策略目标(最大化)、价值函数损失(最小化)、熵正则化(最大化,促进探索)。

  3. GAE 优势估计:使用广义优势估计(λ=0.95)计算 Â_t,在偏差-方差之间取得平衡,是 PPO 训练稳定的关键。

  4. 数据复用(多轮更新):每批数据收集后执行 K=10 轮 mini-batch 更新,提高样本效率,是相较 TRPO 的重要工程优势。

  5. 工程细节:优势归一化 (Â-mean)/std;梯度裁剪 max norm 0.5;Adam 学习率 3e-4;并行环境数据收集(N×T transitions)。

  6. 广泛应用OpenAI Dactyl(机器人)、OpenAI Five(Dota2)、InstructGPT/ChatGPT(RLHF)、AlphaStar,是 RLHF 标准算法选择。

来源

相关