强化学习三大范式
概述
强化学习算法按学习对象分为三大范式:Value-Based(学价值函数)、Policy-Based(直接优化策略)、Actor-Critic(同时学习两者)。三者在方差-偏差、连续动作支持、样本效率上各有取舍。
关键内容
- Value-Based(基于价值):
- 核心:学习价值函数,策略由价值函数贪心导出(π(s) = argmax_a Q(s,a))
- 策略表示:隐式(argmax Q(s,a))
- 优化目标:最小化 TD 误差(贝尔曼方程)
- 代表算法:DQN, Double DQN, Dueling DQN, PER, Rainbow
-
优势:样本效率高(经验回放),Q 值可解释;劣势:难处理连续动作,函数逼近引入偏差
-
Policy-Based(基于策略):
- 核心:直接参数化并优化策略 π_θ(a|s)
- 策略表示:显式(概率分布)
- 优化目标:最大化 J(θ) = E[R],用策略梯度定理梯度上升
- 代表算法:REINFORCE, TRPO, PPO
-
优势:天然支持连续动作,估计无偏;劣势:方差高,样本效率低(on-policy)
-
Actor-Critic(演员-评论家):
- 核心:同时学习策略(Actor)和价值函数(Critic),互相配合
- Actor 用策略梯度更新,Critic 用 TD 误差更新
- 代表算法:A3C, DDPG, TD3, SAC
-
优势:结合两者优点,方差-偏差居中,支持连续动作
-
核心张力对比:
| 维度 | Value-Based | Policy-Based | Actor-Critic |
|---|---|---|---|
| 方差 | 低(Bootstrapping) | 高(MC采样) | 中 |
| 偏差 | 高(函数逼近) | 低(无偏) | 中 |
| 连续动作 | 困难 | 天然支持 | 天然支持 |
| 样本效率 | 高 | 低(on-policy) | 中-高 |
| 稳定性 | 中 | 低 | 高 |
-
历史演化:三大范式并非相互排斥,现代最优算法(SAC, PPO)均融合了多范式思想。SAC 在 Actor-Critic 框架上引入最大熵思想;PPO 用 Clip 目标简化 TRPO 的 KL 约束。
-
算法演化时间线:1992 Q-learning/REINFORCE → 2015 DQN/TRPO → 2016 Double DQN/Dueling/PER/A3C/DDPG → 2017 PPO → 2018 TD3/SAC/Rainbow。三大范式互相借鉴:SAC 在 AC 框架上引入最大熵(Policy-Based 思想);PPO 在 Policy-Based 中引入 Critic 降低方差。
-
一句话定义:
- Value-Based:"评价是关键"——把策略隐藏在价值极值里,工程导向,离散动作霸主
- Policy-Based:"直接才是最优"——梯度穿透策略直接优化目标,理论优美,RLHF 选择
- Actor-Critic:"取长补短"——评价者降低方差,行动者保持策略灵活性,连续控制王者
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图
- raw/assets/RL-Analysis/rl_06_final_comparison — F-01:强化学习算法终极对比分析