Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习数学统计

重要性采样

概述

用行为策略 β 采集的数据估计目标策略 π 下的期望的统计技术。核心公式:E_{x~π}[f(x)] = E_{x~β}[π(x)/β(x)·f(x)],是 off-policy 强化学习和 PPO/TRPO 的数学基础。

关键内容

  1. 核心公式E_{x~π}[f(x)] = E_{x~β}[ (π(x)/β(x)) · f(x) ] π(x)/β(x) 称为重要性权重,修正两个分布之间的采样偏差。

  2. 强化学习中的应用

  3. Off-policy 学习:用旧策略/行为策略采集的经验训练当前策略,提高样本效率
  4. PPO:使用重要性权重 π_θ(a|s)/π_θ_old(a|s) 衡量新旧策略差异,并用 Clip 限制权重范围防止大幅更新
  5. TRPO:代理目标函数中用重要性采样将 on-policy 梯度扩展到邻近策略

  6. 方差问题:当 π 与 β 相差较大时,重要性权重方差爆炸,导致估计不可靠。实践中通过 KL散度 约束(TRPO)或 Clip(PPO)限制权重范围。

  7. 与 off-policy/on-policy 的关系:完全 off-policy(如 DQN)不使用重要性采样,而是通过 Q 函数直接估计价值;PPO 是近似 on-policy,用有限的重要性采样比率。

来源

相关