重要性采样
概述
用行为策略 β 采集的数据估计目标策略 π 下的期望的统计技术。核心公式:E_{x~π}[f(x)] = E_{x~β}[π(x)/β(x)·f(x)],是 off-policy 强化学习和 PPO/TRPO 的数学基础。
关键内容
-
核心公式:
E_{x~π}[f(x)] = E_{x~β}[ (π(x)/β(x)) · f(x) ]π(x)/β(x) 称为重要性权重,修正两个分布之间的采样偏差。 -
在强化学习中的应用:
- Off-policy 学习:用旧策略/行为策略采集的经验训练当前策略,提高样本效率
- PPO:使用重要性权重 π_θ(a|s)/π_θ_old(a|s) 衡量新旧策略差异,并用 Clip 限制权重范围防止大幅更新
-
TRPO:代理目标函数中用重要性采样将 on-policy 梯度扩展到邻近策略
-
方差问题:当 π 与 β 相差较大时,重要性权重方差爆炸,导致估计不可靠。实践中通过 KL散度 约束(TRPO)或 Clip(PPO)限制权重范围。
-
与 off-policy/on-policy 的关系:完全 off-policy(如 DQN)不使用重要性采样,而是通过 Q 函数直接估计价值;PPO 是近似 on-policy,用有限的重要性采样比率。
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图
- raw/assets/RL-Analysis/rl_04_reinforce_trpo_ppo — TRPO/PPO 中重要性采样的具体应用与 Clip 限制