Type: entity
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: NLP预训练模型基础模型GoogleLLM能力

T5

概述

Google 提出的 Text-to-Text Transfer Transformer,将所有 NLP 任务统一为"输入文本→输出文本"格式,是 P5 推荐系统的骨干模型。

关键内容

  1. 模型信息:全称 "Text-to-Text Transfer Transformer",由 Google 研究团队提出。核心设计哲学是将所有 NLP 任务转化为统一的 text-to-text 格式,证明一个模型可同时处理翻译、摘要、问答等多种任务。

  2. 在 P5 中的应用P5 论文 选择 T5 作为骨干模型,因其设计哲学与"将所有推荐任务转化为自然语言输入-输出对"的思想高度契合。P5 使用了 T5-small(60.75M 参数)和 T5-base(223.28M 参数)两个变体,使用 SentencePiece 分词器(词汇表 32,128)。

  3. 架构特点:采用 encoder-decoder Transformer 架构。T5-small 为 6 层编码器 + 6 层解码器,512 维,8 头注意力;T5-base 为 12 层编码器 + 12 层解码器,768 维,12 头注意力

  4. 预训练范式:T5 通过大规模语料上的无监督预训练获得通用语言理解能力,下游任务通过微调适配。P5 沿用这一范式,从预训练 T5 检查点加载权重后进行推荐任务的联合微调。

  5. 与 BERT 的对比:不同于 BERT 的 encoder-only 掩码语言建模,T5 的 encoder-decoder 架构天然支持生成式任务,这使其成为统一推荐(包含解释生成、评论摘要等生成任务)的理想选择。BERT4Rec 等早期工作使用 BERT 做序列推荐,但无法处理生成式任务。

  6. 影响:T5 的"将一切转化为 text-to-text"思想直接启发了 P5 的"Recommendation as Language Processing"范式,成为连接 NLP 基础模型与推荐系统的关键桥梁。

来源

相关