RLHF
概述
基于人类反馈的强化学习,通过人类偏好信号对齐大语言模型输出。
关键内容
- 三步流程:监督微调收集示范数据 → 训练奖励模型学习人类偏好 → 使用 PPO(近端策略优化) 优化策略。
- 对齐目标:使模型输出更符合人类价值观和偏好,减少有害、虚假或不 helpful 的内容。
- ChatGPT 核心:RLHF 是 ChatGPT 成功的关键技术,确立了大语言模型部署的标准实践。
来源
- ai_papers_timeline.md — 2022 年时间线条目
相关
- PPO(近端策略优化) — uses
- InstructGPT — applied_to
- 奖励模型 — uses