因果推断
概述
因果推断是从观测数据中识别和估计因果效应的统计学方法,为推荐系统中的偏差校正提供了理论框架。
关键内容
-
核心问题:区分相关性与因果性。在推荐系统中,用户点击某物品是因为物品本身好(因果效应),还是因为物品排在前面(位置偏差)?因果推断提供了解答这一问题的工具。
-
两大框架:
- 潜在结果框架(Potential Outcomes Framework):以 Rubin 因果模型为代表,通过倾向性评分调整样本权重。Tobias Schnabel 等人的工作属于此框架。
-
结构因果模型框架(Structural Causal Model Framework):通过因果图(DAG)显式建模因果关系,利用 do-calculus 进行因果效应的识别和估计。
-
在推荐系统中的核心概念映射:
- 患者 → 用户
- 治疗方案 → 推荐的物品
- 治疗效果 → 用户评分/反馈
- 是否接受治疗 → 物品是否被观测/评分
- 随机对照试验(RCT) → 随机曝光实验
-
观察性研究 → 普通的日志数据
-
关键工具:
- IPS:逆倾向加权校正选择偏差
- 倾向性评分:量化观测概率
- DR:结合 IPS 和直接方法
-
反事实学习:利用历史日志优化新策略
-
在推荐系统中的影响:因果推断为推荐系统领域打开了整套方法论的大门。2016 年之后,基于因果推断的推荐系统研究呈现爆发式增长,成为 RecSys、KDD、WWW、ICML、NeurIPS 等顶级会议上最活跃的方向之一。
-
假设:因果推断方法依赖"无未观测混杂因子"(no unobserved confounders)假设——所有影响物品是否被观测到的因素都被纳入了倾向性模型。现实中这一假设可能不成立。