Type: concept
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: NLPalignmentRLHFAI工程

InstructGPT

概述

使用 RLHF 对齐的大语言模型,是 ChatGPT 的直接技术前身。

关键内容

  1. RLHF 三步流程:监督微调(SFT)→ 奖励模型训练 → PPO(近端策略优化) 优化。
  2. 对齐效果:在遵循指令、减少有害输出、提高真实性方面显著优于原始 GPT-3
  3. ChatGPT 基础:该方法论成为 ChatGPT 的核心技术,确立了大语言模型对齐的标准实践。

来源

相关