Type: concept
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: NLPalignmentreinforcement-learning强化学习

RLHF

概述

基于人类反馈的强化学习,通过人类偏好信号对齐大语言模型输出。

关键内容

  1. 三步流程:监督微调收集示范数据 → 训练奖励模型学习人类偏好 → 使用 PPO(近端策略优化) 优化策略。
  2. 对齐目标:使模型输出更符合人类价值观和偏好,减少有害、虚假或不 helpful 的内容。
  3. ChatGPT 核心:RLHF 是 ChatGPT 成功的关键技术,确立了大语言模型部署的标准实践。

来源

相关