Type: concept
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: reinforcement-learningpolicy-optimizationPPO强化学习

PPO(近端策略优化)

概述

通过裁剪策略更新实现稳定高效训练的强化学习算法,是 RLHF 的核心优化器。

关键内容

  1. 裁剪目标函数:限制策略更新幅度,避免单次更新过大导致性能崩溃。
  2. 实现简单:相比 TRPO 等复杂算法,PPO 实现简单、调参友好。
  3. RLHF 应用:被用于 InstructGPT 中的 RLHF 对齐,将人类偏好学习融入大语言模型训练。

来源

相关