Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: transformerself-attention推荐系统因果推理LLM能力

因果掩码

概述

因果掩码(Causal Masking)是 Transformer 中实现自回归预测的关键技术,通过下三角掩码矩阵确保每个位置只能关注自身及历史信息,防止未来信息泄露。

关键内容

  1. 核心机制:在 Self-Attention注意力矩阵上施加下三角掩码 $\mathbf{\Delta}$,其中 $\mathbf{\Delta}_{ij} = 1$(if $j \leq i$)或 $-\infty$(if $j > i$)。这意味着第 i 个位置只能"看到"自己及之前的所有位置,无法获取未来信息。

  2. SASRec 中的应用SASRec 与标准 Transformer Encoder 的关键区别。推荐场景天然要求预测必须基于历史信息——预测第 t 步时不能"看到"第 t 步之后的交互。因果掩码使 SASRec 本质上等价于 Transformer Decoder(自回归模式),而非 Encoder 的双向模式。

  3. 与双向注意力的对比BERT4Rec 使用双向注意力(无因果掩码),通过 Cloze 任务训练,序列中每个位置可以利用双向上下文。因果掩码的优势在于符合预测场景的因果性要求,且训练时可一次性预测序列中每个位置的下一个物品。

  4. 信息利用的权衡:因果掩码带来的一个局限是——在训练阶段,序列中靠前的物品无法利用后续物品的信息来优化自身表示,可能导致信息利用不充分。这正是 BERT4Rec 试图解决的问题。

  5. 数学表达:$\text{SA}(\hat{\mathbf{E}}) = \text{softmax}\left(\frac{\mathbf{Q}\mathbf{K}^T}{\sqrt{d}} \odot \mathbf{\Delta}\right) \mathbf{V}$,其中 $-\infty$ 经 softmax 后变为 0,实现信息阻断。

来源

相关