离线策略评估
概述
离线策略评估(OPE)利用历史日志数据评估新策略的性能,而无需在线部署,是强化学习和推荐系统中的关键评估范式。
关键内容
-
核心问题:给定一个由旧策略(logging policy)产生的历史数据集,如何无偏地估计新策略(target policy)的性能?这在在线实验成本高或风险大的场景中尤为重要。
-
主要方法:
- 逆倾向评分(IPS):对历史样本按新旧策略倾向性之比加权,是无偏估计的标准方法
- SNIPS:IPS 的自归一化版本,降低方差
- DR:结合 IPS 和直接方法,提供双重保护
-
直接方法(Direct Method):直接建模奖励函数并在新策略下积分
-
在推荐系统中的应用:Tobias Schnabel 等人将 OPE 引入推荐系统,用于评估推荐算法的真实性能。推荐系统中的 OPE 特殊之处在于:物品空间巨大、倾向性评分难以精确估计、反馈信号稀疏。
-
挑战:
- 覆盖度(coverage):新策略可能推荐旧策略从未推荐的物品,导致重要性权重无限大
- 方差:IPS 类方法在策略差异大时方差极高
-
倾向性估计:旧策略的倾向性评分通常未知,需要从数据中估计
-
标准基线:在 OPE 研究中,IPS 和 SNIPS 已经成为标准的基线方法,后续工作在此基础上提出了大量改进方法(如截断 IPS、序列 IPS 等)。