反事实学习
概述
反事实学习利用历史日志数据评估和优化新的推荐策略,而无需在线实验,是因果推断在推荐系统中的核心应用方向之一。
关键内容
-
核心问题:给定一个由旧推荐策略产生的历史日志数据,如何评估和优化一个新的推荐策略,而不需要在线部署新策略进行 A/B 测试?
-
与 IPS 的关系:反事实学习的核心工具是 IPS。通过逆倾向加权,可以从旧策略产生的有偏日志数据中无偏地估计新策略的性能。
-
与离线策略评估的关系:反事实学习是 OPE 在推荐系统中的具体应用。OPE 是强化学习中的经典问题——如何在不执行新策略的情况下评估其价值。
-
在推荐系统中的挑战:
- 需要知道旧策略的倾向性评分(即旧策略推荐每个物品的概率)
- 日志数据中只包含被推荐物品的反馈,未推荐物品的反馈未知
-
新策略可能推荐旧策略从未推荐的物品,导致倾向性为零
-
应用场景:
- 离线评估新推荐算法,减少在线 A/B 测试的成本和风险
- 利用历史数据优化推荐策略,加速迭代
-
在无法进行在线实验的场景下(如医疗推荐、金融推荐)评估策略
-
后续发展:Tobias Schnabel 等人的工作之后,反事实学习在推荐系统中得到了广泛应用,包括反事实排序学习、反事实策略优化等方向。