奖励模型
概述
在 RLHF 中用于学习人类偏好的模型,为强化学习优化提供奖励信号。
关键内容
- 训练方式:通过人类对多个模型输出的排序数据训练,学习预测哪个输出更符合人类偏好。
- RLHF 核心:是 RLHF 三步流程中的第二步,为 PPO(近端策略优化) 提供奖励信号。
- 对齐关键:奖励模型的质量直接决定了大语言模型对齐的效果。
来源
- ai_papers_timeline.md — 2022 年时间线条目
相关
- RLHF — used_in
- InstructGPT — used_in
- PPO(近端策略优化) — relates_to