生成式推荐
概述
将推荐问题重新定义为端到端序列生成任务,用单一模型统一召回和排序,通过自回归方式预测用户下一个交互 token,是推荐系统领域的范式转换。
关键内容
-
核心思想:将用户历史行为表示为时间序列 ${(c_1, a_1), (c_2, a_2), \ldots, (c_t, a_t)}$,其中 $c_i$ 为内容 token(交互物品),$a_i$ 为动作 token(交互类型:点击、停留、购买等)。召回建模为预测 $c_{t+1}$,排序建模为预测 $a_{t+1}$(给定候选后预测互动行为),两者统一到单一模型中。
-
与传统架构的对比:传统 级联推荐管道(召回→粗排→精排→重排)各阶段独立优化,信息在传递中不断丢失。两阶段推荐架构 中召回和排序使用不同模型和优化目标。生成式推荐通过端到端序列生成消除了阶段间信息损失。
-
代价与收益:每次交互编码为 2 个 token(内容+动作),序列长度翻倍,注意力 FLOPs 增长四倍。但换来架构极大简化——不再需要独立的召回模型和排序模型。
-
特征序列化:将传统 DLRM 中的异构特征空间(用户画像、物品属性、上下文信息)全部序列化为 token 序列,每个特征表示为序列中的辅助事件。当序列长度趋于无穷时,序列化表示可逼近完整 DLRM 特征空间。
-
Scaling Laws 验证:HSTU 架构下,生成式推荐模型质量随训练计算量呈幂律增长,跨越三个数量级至 GPT-3/LLaMA-2 规模。传统 DLRM 在约 200B 参数后性能饱和,无法继续受益于更多计算。
-
工业部署:M-FALCON 算法使 1.5 万亿参数生成式推荐模型在相同推理预算下运行,实现 1.5x-2.99x 吞吐量提升。Meta 在数十亿用户平台上部署,在线 A/B 测试提升 12.4%。
-
行业影响:截至 2025-2026 年,Google、快手、美团、阿里、Netflix、小红书、字节、腾讯、百度、京东等均已探索或部署生成式推荐。MLCommons DLRMv3 基准受其启发将模型规模提升 20 倍。
-
局限性:高度依赖用户历史序列,冷启动场景挑战大;万亿参数黑盒可解释性差;训练成本极高;端到端设计使调试和迭代更困难。
来源
- Actions Speak Louder than Words (ArXiv)
- The Rise of Generative Recommenders (ML Frontiers)
- Is this the ChatGPT moment for recommendation systems? (Shaped.ai)
- NVIDIA HSTU 实现