指令调优
概述
用自然语言指令替代固定 Prompt 模板来训练 LLM 推荐模型的方法,是 P5 Prompt 模板范式的现代演进。
关键内容
-
概念定义:指令调优(Instruction Tuning)是在大规模指令数据集上微调语言模型,使其能够遵循自然语言指令完成各种任务的方法。在推荐系统中,它将 P5 的固定 Prompt 模板升级为更灵活的指令格式。
-
与个性化 Prompt的对比:
- P5(2022):47 个固定 Prompt 模板,措辞和格式预先定义
-
指令调优(2024-2025):自然语言指令,格式更灵活,覆盖更广的任务描述空间
-
InstructRec 方案:微信团队提出的基于指令调优的推荐方法,借鉴了 P5 的任务统一思想,但用指令格式替代 Prompt 模板,使模型能够理解更复杂的推荐指令。
-
TALLRec 方案:首个尝试用大语言模型(LLaMA)进行推荐任务微调的工作,使用指令调优使 LLaMA 适配推荐场景。
-
优势:
- 更灵活的任务描述:不局限于预定义的 Prompt 模板
- 更强的泛化能力:指令格式可以组合和扩展
-
更好的 zero-shot/few-shot 能力:模型学会"遵循指令"的元能力
-
在现代方案中的地位:从 P5 到现代方案的演进中,指令调优替代 Prompt 模板成为任务统一的主要方式,配合 LoRA/QLoRA 参数高效微调,使大规模 LLM 推荐成为可能。
来源
- Shijie Geng et al. — P5: Recommendation as Language Processing, RecSys 2022 (arXiv:2203.13366)
- InstructRec 论文 — Instruction Tuning for Recommendation
- TALLRec 论文 — LLaMA-based Recommendation with Instruction Tuning
相关
- P5 论文 — Prompt 模板范式的开创者
- 个性化 Prompt — 指令调优的前身
- InstructRec — 使用指令调优的推荐方法
- TALLRec — 使用指令调优的 LLaMA 推荐
- 生成式推荐 (LLM) — 指令调优服务的范式
- 多任务学习 — 指令调优的训练策略基础