Type: concept
Confidence: 0.80
Created: 2026-04-26
Updated: 2026-04-26
Tags: 推荐系统用户建模多峰分布表示学习DIN机器学习

多峰分布(用户兴趣)

概述

用户兴趣在向量空间中呈现多峰(multi-modal)分布特征,即用户的不同兴趣点在向量空间中形成多个独立的聚类中心,而非单一的集中分布。这一洞察是DIN等现代推荐系统的重要理论基础。

关键内容

  1. 理论背景 — 传统推荐系统将用户历史行为通过Sum Pooling或Average Pooling等操作聚合为固定长度向量,隐含假设用户兴趣是单峰分布。但现实中,用户的兴趣覆盖多个品类(如购物、娱乐、学习),在向量空间中呈现多峰特征。

  2. 推荐系统中的表现 — 一个典型用户可能同时对电子产品、美食、健身等多个领域感兴趣。这些兴趣在向量空间中对应不同的区域,强行用单一向量概括所有兴趣会导致表示失真。将多个兴趣峰平均后的向量可能落在完全不相关的空间位置上。

  3. 对传统方法的挑战 — 多峰分布特性挑战了传统Embedding&MLP范式中的固定长度向量假设。Sum Pooling/Average Pooling等操作无法有效表达多样化兴趣,形成了严重的表示瓶颈。

  4. DIN的解决方案 — DIN首次系统性地利用"用户兴趣多峰分布"洞察,提出通过局部激活机制动态关注与当前候选物品相关的兴趣峰,而非强制用单一向量表达所有兴趣。

  5. 后续影响 — 这一洞察催生了多种兴趣建模方法:DIEN通过RNN建模兴趣演化;MIND提取多个兴趣向量;ComiRec通过聚类提取多样兴趣表示。这些方法都源于对用户兴趣多峰性质的认知。

  6. 实际案例 — 用户可能浏览过运动装备、烹饪书籍、旅游攻略等完全不相关的物品。传统方法会将这些行为的Embedding简单平均,产生一个"模糊"的用户表示。而基于多峰分布的方法则能根据不同候选物品激活相关的兴趣峰。

  7. 数学表达 — 设用户U的n个不同兴趣峰对应向量${v_1, v_2, ..., v_n}$,传统方法计算$\bar{v} = \frac{1}{n}\sum_{i=1}^{n} v_i$,而多峰方法在面对候选物品c时选择性激活相关峰$v_{active} = f({v_i}, c)$。

来源

相关