PPO(近端策略优化)
概述
通过裁剪策略更新实现稳定高效训练的强化学习算法,是 RLHF 的核心优化器。
关键内容
- 裁剪目标函数:限制策略更新幅度,避免单次更新过大导致性能崩溃。
- 实现简单:相比 TRPO 等复杂算法,PPO 实现简单、调参友好。
- RLHF 应用:被用于 InstructGPT 中的 RLHF 对齐,将人类偏好学习融入大语言模型训练。
来源
- ai_papers_timeline.md — 2017 年时间线条目
相关
- John Schulman — relates_to
- RLHF — used_in
- InstructGPT — applied_to