负迁移
概述
负迁移(Negative Transfer)是多任务学习中的核心问题,指当不同任务的学习信号冲突时,共享参数被拉向不同方向导致所有任务性能下降的现象。
关键内容
产生机制
- 多任务模型中多个任务共享底层参数,各自产生梯度信号
- 当任务间相关性较低或目标冲突时,梯度方向相互矛盾
- 共享参数在优化过程中被不同任务的梯度"角力",无法收敛到最优解
- 类比:强制学生用完全相同的学习策略学习数学和音乐,两门课都学不好
在推荐系统中的表现
- 推荐系统需同时优化多目标:CTR 预估、CVR、观看时长、满意度等
- 追求高点击率可能导致"标题党"内容被推荐,损害用户满意度
- 点击率高的商品未必是用户最终会购买的商品,过度优化点击率可能降低购买转化率
- 负迁移后果:本应提升所有指标的多任务模型反而让某些指标不升反降
不同架构的负迁移抵抗能力
- Shared-Bottom:抵抗能力弱,默认所有任务底层表示完全一致,任务相关性低时是危险假设
- OMoE:抵抗能力中等,模块化专家网络但所有任务看到相同专家组合权重
- MMoE:抵抗能力强,通过独立门控实现梯度隔离和专家特化
MMoE 的缓解机制
- 梯度隔离:不同任务通过各自门控网络传递梯度,冲突时可调低相关专家权重
- 专家特化:训练中部分专家特化为服务特定任务,另一些保持通用性,减少任务间干扰
- 软性参数分配:参数分配连续柔性,比硬性分割更精细地平衡共享与隔离
未完全解决的问题
- Seesaw Phenomenon">[跷跷板现象]:PLE 论文指出,优化一任务性能时另一任务仍可能下降
- 专家网络完全共享,来自不同任务的梯度信号仍在专家网络中"角力"
- PLE 通过显式分离共享专家和任务特定专家进一步解决此问题
来源
- raw/books/推荐系统/14-mmoe.md — MMoE 深度解读文章,详细分析负迁移机制
相关
- 多任务学习 — 负迁移发生的上下文
- MMoE — 通过 Multi-gate 设计有效缓解负迁移
- Shared-Bottom — 对负迁移抵抗能力弱的架构
- PLE — 进一步解决负迁移遗留问题的后续工作