二元交叉熵
概述
二分类任务的损失函数,在推荐系统中用于隐式反馈场景,将用户-物品交互建模为概率预测问题,替代传统的均方误差(MSE)。
关键内容
- 公式:$\mathcal{L} = -\sum_{(u,i) \in \mathcal{Y}^+ \cup \mathcal{Y}^-} [y_{ui} \log \hat{y}{ui} + (1 - y{ui}) \log(1 - \hat{y}_{ui})]$,其中 $\mathcal{Y}^+$ 是观察到的正向交互集合,$\mathcal{Y}^-$ 是通过负采样得到的负样本集合。
- 在推荐系统中的应用:Neural Collaborative Filtering 论文将隐式反馈推荐从回归问题重新建模为二分类问题,采用二元交叉熵替代传统 MF 常用的均方误差(MSE)。对于 0/1 二值数据,交叉熵在概率意义上更加合理,将问题建模为"用户是否会与该物品交互"的概率预测。
- 与 MSE 的对比:NCF 实验表明,使用二元交叉熵(log loss)训练的模型显著优于使用均方误差训练的版本。MSE 更适合连续值评分预测(如显式反馈的 1-5 星评分),而交叉熵更适合隐式反馈的 0/1 二值数据。
- 负采样依赖:二元交叉熵在隐式反馈场景下需要负采样构造负样本集合 $\mathcal{Y}^-$。NCF 论文中设定负采样比例为每个正样本对应 4-5 个负样本,从未观察到的交互中均匀采样。
- 后续影响:NCF 采用二元交叉熵的选择为后来的推荐系统研究设定了重要的实践范式,后续的深度学习推荐模型(如Wide & Deep、DeepFM等)在隐式反馈场景下普遍采用交叉熵作为损失函数。
来源
- 10-ncf.md — Neural Collaborative Filtering 论文详细解读
相关
- Neural Collaborative Filtering — 采用二元交叉熵的里程碑论文
- 隐式反馈 — 二元交叉熵适用的数据场景
- 负采样 — 二元交叉熵训练中的负样本构造策略
- RMSE — 与 MSE 相关的评估指标,适用于显式反馈场景
- 显式反馈 — 更适合 MSE 的数据场景