策略梯度定理
概述
Policy-Based 和 Actor-Critic 方法的数学基石。给出参数化策略 π_θ 的目标函数 J(θ) 关于参数 θ 的梯度公式,使得可以用梯度上升直接优化策略。
关键内容
-
核心公式:
∇_θ J(θ) = E_{τ~π_θ} [ Σ_t ∇_θ log π_θ(a_t|s_t) · Q^π(s_t,a_t) ]梯度方向由"选择动作的对数概率梯度"与"该动作的 Q 值"的乘积决定。 -
直觉解释:Q 值高的动作(好的选择)会增加其被选中的概率,Q 值低的动作概率降低。这是"试错"学习的精确数学表达。
-
REINFORCE 算法:Williams (1992) 用蒙特卡洛回报 G_t 近似 Q^π(s_t,a_t),得到 REINFORCE 算法,是策略梯度的最简实现,但方差极高。
-
基线(Baseline)技术:在 Q^π(s_t,a_t) 上减去基线 b(s_t) 不改变梯度期望,但显著降低方差:
∇_θ J(θ) = E [ Σ_t ∇_θ log π_θ(a_t|s_t) · (Q^π(s_t,a_t) - b(s_t)) ]常用 V^π(s_t) 作为基线,此时括号内变为优势函数 A^π(s_t,a_t)。 -
TRPO/PPO 的扩展:TRPO 在策略梯度上加 KL 散度约束保证单调改进;PPO 用 Clip 目标函数作为实用近似,避免复杂的二阶优化。
-
重要性采样的作用:off-policy 场景下,用行为策略 β 采集的数据估计目标策略 π 的梯度,需乘以重要性权重 π(a|s)/β(a|s)。
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图
- raw/assets/RL-Analysis/rl_04_reinforce_trpo_ppo — REINFORCE/TRPO/PPO 完整推导与对比