Type: entity
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 推荐系统生成式推荐LLMMetaSelf-AttentionScaling LawsICML 2024

HSTU

概述

HSTU(Hierarchical Sequential Transduction Unit),Meta 在 ICML 2024 发表的万亿参数生成式推荐架构,针对推荐场景改造 Transformer,首次在工业级推荐系统中验证 Scaling Laws,在线 A/B 测试提升 12.4%。

关键内容

  1. 论文信息Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations,作者 Jiaqi Zhai 等(Meta MRS/PyTorch/AI Infra/Instagram 团队),ICML 2024(PMLR 235:58484-58509),ArXiv: 2402.17152,代码开源: github.com/meta-recsys/generative-recommenders

  2. 核心方法:将序列推荐从判别式模型转向生成式模型。用户行为序列被表示为时间序列 ${(c_1, a_1), (c_2, a_2), \ldots, (c_t, a_t)}$,其中 $c_i$ 为内容 token,$a_i$ 为动作 token(点击、停留、购买等)。召回建模为预测下一个内容 token $c_{t+1}$,排序建模为预测下一个动作 token $a_{t+1}$,两者统一到单一模型中。

  3. HSTU 架构改造(与标准 Transformer 的关键区别):

  4. SiLU 注意力替代 Softmax注意力分数计算使用 $\phi_2(QK^\top + \text{relative_attention_bias}) \cdot V$,其中 $\phi_2$ 为 SiLU 激活而非 Softmax。保留偏好强度信息,适应非平稳分布。消融实验证实 Softmax 替换导致性能下降。
  5. 相对注意力偏置替代绝对位置编码:将位置信息和时间间隔作为相对偏置直接注入注意力分数,同时编码序列顺序和交互时间距离。
  6. 门控机制(U 矩阵:在 QKV 之外引入 U 矩阵作为门控信号,通过 Hadamard 乘积控制特征交互贡献,类似 LSTM 门控
  7. 精简架构注意力外线性层从 6 个减少到 2 个,激进融合计算操作,降低激活内存。
  8. 因果掩码:单向注意力,确保自回归生成合法性。

  9. SASRec 的关系:HSTU 的自回归生成式思路可以追溯到 SASRec 建立的因果掩码 + 自注意力框架。SASRec 为今天的生成式推荐奠定了概念基础。

  10. 部署规模:1.5 万亿参数,1000 亿训练样本,256 块 H100 GPU 训练,部署于 Meta 数十亿用户平台,日均处理数百亿次用户交互。

  11. 实验结果

  12. 离线 NDCG 提升高达 65.8%;8192 长度序列上比 FlashAttention2 Transformer 快 5.3x-15.2x。
  13. 在线 A/B 测试主要参与指标提升 12.4%(工业级极为罕见),HR@100 从 29.0% 提升到 36.9%。
  14. 消融实验:仅用交互特征下降 2.6%,仅用内容特征下降 25.3%,验证"Actions Speak Louder than Words"。

  15. 局限性:训练成本极高(仅科技巨头可复制);序列长度翻倍致 FLOPs 四倍增长;冷启动问题未专门讨论;万亿参数黑盒可解释性差;外部复现困难。

  16. 历史地位:被广泛认为是推荐系统的"GPT 时刻",推动了 Google、快手、美团、阿里、Netflix、字节等向生成式推荐范式迁移。MLCommons DLRMv3 基准直接受其启发。

来源

相关