T5
概述
Google 提出的 Text-to-Text Transfer Transformer,将所有 NLP 任务统一为"输入文本→输出文本"格式,是 P5 推荐系统的骨干模型。
关键内容
-
模型信息:全称 "Text-to-Text Transfer Transformer",由 Google 研究团队提出。核心设计哲学是将所有 NLP 任务转化为统一的 text-to-text 格式,证明一个模型可同时处理翻译、摘要、问答等多种任务。
-
在 P5 中的应用:P5 论文 选择 T5 作为骨干模型,因其设计哲学与"将所有推荐任务转化为自然语言输入-输出对"的思想高度契合。P5 使用了 T5-small(60.75M 参数)和 T5-base(223.28M 参数)两个变体,使用 SentencePiece 分词器(词汇表 32,128)。
-
架构特点:采用 encoder-decoder Transformer 架构。T5-small 为 6 层编码器 + 6 层解码器,512 维,8 头注意力;T5-base 为 12 层编码器 + 12 层解码器,768 维,12 头注意力。
-
预训练范式:T5 通过大规模语料上的无监督预训练获得通用语言理解能力,下游任务通过微调适配。P5 沿用这一范式,从预训练 T5 检查点加载权重后进行推荐任务的联合微调。
-
与 BERT 的对比:不同于 BERT 的 encoder-only 掩码语言建模,T5 的 encoder-decoder 架构天然支持生成式任务,这使其成为统一推荐(包含解释生成、评论摘要等生成任务)的理想选择。BERT4Rec 等早期工作使用 BERT 做序列推荐,但无法处理生成式任务。
-
影响:T5 的"将一切转化为 text-to-text"思想直接启发了 P5 的"Recommendation as Language Processing"范式,成为连接 NLP 基础模型与推荐系统的关键桥梁。
来源
- Colin Raffel et al. — Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer, JMLR 2020
- Shijie Geng et al. — P5: Recommendation as Language Processing, RecSys 2022