Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 推荐系统因果推断偏差

选择偏差

概述

选择偏差指用户倾向于只对感兴趣的物品进行评分或交互,导致观测数据并非真实偏好的随机样本,而是经过自我筛选的有偏样本。

关键内容

  1. 本质:在推荐系统中,用户可能看过 1000 部电影但只给 30 部打分——这 30 部大概率是特别喜欢或特别讨厌的。那些"一般般"的电影不会出现在评分记录中。观测到的评分数据因此不是全量数据的无偏子集。

  2. 与 MNAR 的关系:选择偏差是 MNAR(非随机缺失)的典型表现。某个评分是否被观测到,与该评分的值本身高度相关——用户更倾向于评价自己喜欢的东西,导致观测到的评分偏高。

  3. 来源层面Tobias Schnabel 等人指出选择偏差来自两个来源:(a) 用户的自我选择(self-selection),(b) 推荐系统自身的行为。后者形成反馈循环——推荐系统的偏差导致有偏的训练数据,有偏的训练数据又强化了推荐系统的偏差。

  4. 对训练的影响:在选择偏差数据上训练的模型会继承这种偏差,如过度推荐热门内容、忽视冷门但优质的长尾物品。

  5. 对评估的影响:如果评估本身有偏,就无法可靠比较不同推荐算法的优劣,也无法判断新方法是否真正带来改进。

  6. 校正方法:IPS 通过逆倾向加权校正选择偏差,使稀有观测获得更高权重。SNIPS 进一步降低方差。双重鲁棒估计器 结合 IPS 和直接方法提供双重保护。

  7. 流行度偏差位置偏差的区别:选择偏差关注用户主动选择行为的偏差;流行度偏差 关注热门物品获得过多曝光;位置偏差 关注列表位置对点击的影响。三者常同时存在,共同构成推荐系统的偏差困局。

来源

相关