Type: concept
Confidence: 0.80
Created: 2026-04-16
Updated: 2026-04-16
Tags: 因果推断强化学习推荐系统评估方法

离线策略评估

概述

离线策略评估(OPE)利用历史日志数据评估新策略的性能,而无需在线部署,是强化学习和推荐系统中的关键评估范式

关键内容

  1. 核心问题:给定一个由旧策略(logging policy)产生的历史数据集,如何无偏地估计新策略(target policy)的性能?这在在线实验成本高或风险大的场景中尤为重要。

  2. 主要方法

  3. 逆倾向评分(IPS):对历史样本按新旧策略倾向性之比加权,是无偏估计的标准方法
  4. SNIPS:IPS 的自归一化版本,降低方差
  5. DR:结合 IPS 和直接方法,提供双重保护
  6. 直接方法(Direct Method):直接建模奖励函数并在新策略下积分

  7. 在推荐系统中的应用Tobias Schnabel 等人将 OPE 引入推荐系统,用于评估推荐算法的真实性能。推荐系统中的 OPE 特殊之处在于:物品空间巨大、倾向性评分难以精确估计、反馈信号稀疏。

  8. 挑战

  9. 覆盖度(coverage):新策略可能推荐旧策略从未推荐的物品,导致重要性权重无限大
  10. 方差:IPS 类方法在策略差异大时方差极高
  11. 倾向性估计:旧策略的倾向性评分通常未知,需要从数据中估计

  12. 反事实学习的关系:OPE 是反事实学习的评估组件。反事实学习利用 OPE 提供的无偏性能估计来优化新策略。

  13. 标准基线:在 OPE 研究中,IPS 和 SNIPS 已经成为标准的基线方法,后续工作在此基础上提出了大量改进方法(如截断 IPS、序列 IPS 等)。

来源

相关