M-FALCON
概述
M-FALCON(Microbatched-Fast Attention Leveraging Cacheable OperatioNs),Meta 提出的高效推理算法,使万亿参数生成式推荐模型在毫秒级延迟和相同推理预算下运行。
关键内容
-
核心问题:1.5 万亿参数的 HSTU 模型如何在生产环境中以毫秒级延迟运行?Meta 推荐系统每天处理数百亿次用户交互,推理延迟要求在毫秒级别。
-
KV 缓存复用:用户历史序列的 KV 缓存可在编码阶段完成后缓存下来,对所有候选物品共享复用。避免为每个候选重复计算历史序列的注意力。
-
微批处理(Micro-batching):将候选物品分成小批次,通过修改注意力掩码防止候选之间信息泄露,同时共享历史序列的计算。推理成本随候选数量线性增长而非二次增长。
-
计算摊销:通过 KV 缓存 + 微批处理,历史序列的计算被所有候选摊销。最终实现 285 倍复杂度的模型在相同推理预算下运行,同时获得 1.5x-2.99x 吞吐量提升。
-
工程意义:M-FALCON 是生成式推荐从理论走向工业部署的关键工程创新。没有它,万亿参数模型的推理成本在经济上不可行。
-
与 两阶段推荐架构 的关系:传统架构中召回层用 ANN 快速筛选候选,排序层用复杂模型精细排序。M-FALCON 使单一生成式模型能以可接受成本直接处理大量候选,模糊了召回和排序的边界。