Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习

强化学习三大范式

概述

强化学习算法按学习对象分为三大范式:Value-Based(学价值函数)、Policy-Based(直接优化策略)、Actor-Critic(同时学习两者)。三者在方差-偏差、连续动作支持、样本效率上各有取舍。

关键内容

  1. Value-Based(基于价值)
  2. 核心:学习价值函数,策略由价值函数贪心导出(π(s) = argmax_a Q(s,a))
  3. 策略表示:隐式(argmax Q(s,a))
  4. 优化目标:最小化 TD 误差(贝尔曼方程
  5. 代表算法:DQN, Double DQN, Dueling DQN, PER, Rainbow
  6. 优势:样本效率高(经验回放),Q 值可解释;劣势:难处理连续动作,函数逼近引入偏差

  7. Policy-Based(基于策略)

  8. 核心:直接参数化并优化策略 π_θ(a|s)
  9. 策略表示:显式(概率分布)
  10. 优化目标:最大化 J(θ) = E[R],用策略梯度定理梯度上升
  11. 代表算法REINFORCE, TRPO, PPO
  12. 优势:天然支持连续动作,估计无偏;劣势:方差高,样本效率低(on-policy)

  13. Actor-Critic(演员-评论家)

  14. 核心:同时学习策略(Actor)和价值函数(Critic),互相配合
  15. Actor 用策略梯度更新,Critic 用 TD 误差更新
  16. 代表算法:A3C, DDPG, TD3, SAC
  17. 优势:结合两者优点,方差-偏差居中,支持连续动作

  18. 核心张力对比

维度 Value-Based Policy-Based Actor-Critic
方差 低(Bootstrapping) 高(MC采样)
偏差 高(函数逼近) 低(无偏)
连续动作 困难 天然支持 天然支持
样本效率 低(on-policy) 中-高
稳定性
  1. 历史演化:三大范式并非相互排斥,现代最优算法(SAC, PPO)均融合了多范式思想。SAC 在 Actor-Critic 框架上引入最大熵思想;PPO 用 Clip 目标简化 TRPO 的 KL 约束。

  2. 算法演化时间线:1992 Q-learning/REINFORCE → 2015 DQN/TRPO → 2016 Double DQN/Dueling/PER/A3C/DDPG → 2017 PPO → 2018 TD3/SAC/Rainbow。三大范式互相借鉴:SAC 在 AC 框架上引入最大熵(Policy-Based 思想);PPO 在 Policy-Based 中引入 Critic 降低方差。

  3. 一句话定义

  4. Value-Based:"评价是关键"——把策略隐藏在价值极值里,工程导向,离散动作霸主
  5. Policy-Based:"直接才是最优"——梯度穿透策略直接优化目标,理论优美,RLHF 选择
  6. Actor-Critic:"取长补短"——评价者降低方差,行动者保持策略灵活性,连续控制王者

来源

相关