Type: concept
Confidence: 0.80
Created: 2026-04-16
Updated: 2026-04-16
Tags: 因果推断推荐系统离线学习

反事实学习

概述

反事实学习利用历史日志数据评估和优化新的推荐策略,而无需在线实验,是因果推断在推荐系统中的核心应用方向之一。

关键内容

  1. 核心问题:给定一个由旧推荐策略产生的历史日志数据,如何评估和优化一个新的推荐策略,而不需要在线部署新策略进行 A/B 测试?

  2. 与 IPS 的关系:反事实学习的核心工具是 IPS。通过逆倾向加权,可以从旧策略产生的有偏日志数据中无偏地估计新策略的性能。

  3. 离线策略评估的关系:反事实学习是 OPE 在推荐系统中的具体应用。OPE 是强化学习中的经典问题——如何在不执行新策略的情况下评估其价值。

  4. 在推荐系统中的挑战

  5. 需要知道旧策略的倾向性评分(即旧策略推荐每个物品的概率)
  6. 日志数据中只包含被推荐物品的反馈,未推荐物品的反馈未知
  7. 新策略可能推荐旧策略从未推荐的物品,导致倾向性为零

  8. 应用场景

  9. 离线评估新推荐算法,减少在线 A/B 测试的成本和风险
  10. 利用历史数据优化推荐策略,加速迭代
  11. 在无法进行在线实验的场景下(如医疗推荐、金融推荐)评估策略

  12. 后续发展Tobias Schnabel 等人的工作之后,反事实学习在推荐系统中得到了广泛应用,包括反事实排序学习、反事实策略优化等方向。

来源

相关