Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习数学优化

策略梯度定理

概述

Policy-BasedActor-Critic 方法的数学基石。给出参数化策略 π_θ 的目标函数 J(θ) 关于参数 θ 的梯度公式,使得可以用梯度上升直接优化策略。

关键内容

  1. 核心公式∇_θ J(θ) = E_{τ~π_θ} [ Σ_t ∇_θ log π_θ(a_t|s_t) · Q^π(s_t,a_t) ] 梯度方向由"选择动作的对数概率梯度"与"该动作的 Q 值"的乘积决定。

  2. 直觉解释:Q 值高的动作(好的选择)会增加其被选中的概率,Q 值低的动作概率降低。这是"试错"学习的精确数学表达。

  3. REINFORCE 算法:Williams (1992) 用蒙特卡洛回报 G_t 近似 Q^π(s_t,a_t),得到 REINFORCE 算法,是策略梯度的最简实现,但方差极高。

  4. 基线(Baseline)技术:在 Q^π(s_t,a_t) 上减去基线 b(s_t) 不改变梯度期望,但显著降低方差: ∇_θ J(θ) = E [ Σ_t ∇_θ log π_θ(a_t|s_t) · (Q^π(s_t,a_t) - b(s_t)) ] 常用 V^π(s_t) 作为基线,此时括号内变为优势函数 A^π(s_t,a_t)。

  5. TRPO/PPO 的扩展:TRPO 在策略梯度上加 KL 散度约束保证单调改进;PPO 用 Clip 目标函数作为实用近似,避免复杂的二阶优化。

  6. 重要性采样的作用:off-policy 场景下,用行为策略 β 采集的数据估计目标策略 π 的梯度,需乘以重要性权重 π(a|s)/β(a|s)。

来源

相关