双重鲁棒估计器
概述
双重鲁棒估计器结合逆倾向评分(IPS)和直接方法(Direct Method),即使其中一个模型(倾向性模型或结果模型)出错,估计器仍然保持无偏。
关键内容
-
核心思想:双重鲁棒(Doubly Robust, DR)估计器同时使用两个模型——倾向性模型(估计观测概率)和结果模型(直接预测评分/结果)。只要其中至少一个模型正确,估计器就是无偏的。这提供了"双重保护"。
-
与 IPS 的关系:DR 可以看作是 IPS 的增强版本。IPS 仅依赖倾向性模型,当倾向性估计不准确时可能产生较大偏差。DR 通过引入结果模型作为补充,降低了对方差敏感的倾向性权重的依赖。
-
数学形式:DR 估计器结合了 IPS 项和直接预测项。当倾向性模型正确时,DR 无偏;当结果模型正确时,DR 也无偏。这种双重保证使其在实践中比纯 IPS 更稳定。
-
在推荐系统中的应用:Wang 等人(2019)将 DR 方法引入推荐系统,用于去偏的推荐评估和训练。后续工作进一步将 DR 与深度学习结合,提出了神经双重鲁棒等方法。
-
优势:
- 比纯 IPS 更低的方差
- 双重保护:一个模型出错时另一个可以补偿
-
在实践中通常比 IPS 和直接方法都更准确
-
局限性:DR 需要同时训练两个模型(倾向性模型和结果模型),增加了计算复杂度。如果两个模型都不准确,DR 也无法保证无偏性。
来源
- Recommendations as Treatments (Schnabel et al., ICML 2016) — 奠基性工作中提及后续方向
- Doubly Robust Joint Recommendation (Wang et al., 2019)