PPO
概述
Schulman et al. (OpenAI, 2017) 提出的近端策略优化算法。通过 Clip 目标函数近似 TRPO 的信赖域约束,在保留近似单调改进保证的同时实现一阶优化(普通 SGD/Adam),成为 2017-2023 年工业界最广泛使用的 RL 算法,也是 RLHF(InstructGPT/ChatGPT)的核心组件。
关键内容
-
PPO-Clip 核心目标:
L^{CLIP}(θ) = E_t [ min(r_t(θ)·Â_t, clip(r_t(θ), 1-ε, 1+ε)·Â_t) ]r_t(θ) = π_θ/π_θ_old 为重要性采样比,ε=0.2。Clip 操作使梯度在比率超出 [1-ε, 1+ε] 时归零,天然限制更新幅度,无需二阶优化。 -
完整损失函数:
L^{PPO} = L^{CLIP} - c₁·L^{VF} + c₂·S[π]三项分别为策略目标(最大化)、价值函数损失(最小化)、熵正则化(最大化,促进探索)。 -
数据复用(多轮更新):每批数据收集后执行 K=10 轮 mini-batch 更新,提高样本效率,是相较 TRPO 的重要工程优势。
-
工程细节:优势归一化 (Â-mean)/std;梯度裁剪 max norm 0.5;Adam 学习率 3e-4;并行环境数据收集(N×T transitions)。
-
广泛应用:OpenAI Dactyl(机器人)、OpenAI Five(Dota2)、InstructGPT/ChatGPT(RLHF)、AlphaStar,是 RLHF 标准算法选择。
来源
- raw/assets/RL-Analysis/rl_04_reinforce_trpo_ppo — P-03:PPO 完整分析(Schulman et al. OpenAI 2017)