倾向性评分
概述
倾向性评分是某个用户-物品对的评分被观测到的概率,用于量化数据生成过程中的选择偏差,是逆倾向评分加权(IPS)的核心输入。
关键内容
-
定义:对于用户 $u$ 和物品 $i$,倾向性评分定义为 $P_{u,i} = P(O_{u,i} = 1)$,其中 $O_{u,i} = 1$ 表示用户 $u$ 对物品 $i$ 的评分被观测到。
-
直觉理解:
- 热门电影的倾向性评分较高(更多人会去看并评分)
- 冷门纪录片的倾向性评分较低
- 活跃用户的整体倾向性评分较高
-
推荐系统曾经推荐过的物品,倾向性评分较高
-
估计方法(Schnabel et al., 2016):
- 朴素贝叶斯:假设观测概率可分解为用户边际概率和物品边际概率的乘积。用户倾向性通过其评分数量与平均评分数量的比值近似。简单快速,不需要额外特征。
-
逻辑回归:将"是否观测到"作为二分类标签,用户和物品特征作为输入。变体包括:仅用户特征(LR-U)、仅物品特征(LR-I)、同时使用(LR)。
-
在 IPS 中的作用:IPS 估计器 $\hat{R}{IPS} = \frac{1}{U \cdot I} \sum \frac{\delta}{P{u,i}}$ 直接依赖倾向性评分。当倾向性评分已知时,IPS 是无偏的。
-
估计不精确的鲁棒性:Tobias Schnabel 等人的实验表明,即使倾向性估计存在噪声和偏差,IPS 和 SNIPS 仍然显著优于忽略偏差的朴素方法。"大致正确"的倾向性已足以带来显著改善。
-
根本挑战:倾向性评分本身需要从有偏数据中估计,形成"鸡生蛋还是蛋生鸡"的循环依赖。朴素贝叶斯和逻辑回归方法做出了较强的参数化假设(如条件独立性假设)。
-
后续进展:多任务学习(将倾向性模型和推荐模型整合)、对抗学习(平衡准确性和稳定性)、序列倾向性(纳入时间因素)等方法拓展了倾向性估计的能力。