Type: concept
Confidence: 0.70
Created: 2026-04-20
Updated: 2026-04-20
Tags: NLPRLHFalignment强化学习

奖励模型

概述

在 RLHF 中用于学习人类偏好的模型,为强化学习优化提供奖励信号。

关键内容

  1. 训练方式:通过人类对多个模型输出的排序数据训练,学习预测哪个输出更符合人类偏好。
  2. RLHF 核心:是 RLHF 三步流程中的第二步,为 PPO(近端策略优化) 提供奖励信号。
  3. 对齐关键:奖励模型的质量直接决定了大语言模型对齐的效果。

来源

相关