Type: concept
Confidence: 0.90
Created: 2026-04-18
Updated: 2026-04-18
Tags: 机器学习深度学习优化优化器正则化

AdamW

概述 (50-200字符)

AdamW 修正了 Adam 中权重衰减的实现方式,将权重衰减与梯度步骤解耦。Transformer 系列模型的标准优化器,配合 Warmup+Cosine 调度成为现代 LLM 训练标配。

关键内容 (≥300字符, 用双链)

  1. 问题:在原始Adam(自适应矩估计)中,权重衰减通过梯度添加 L2 正则项实现(grad += λ·w)。但这与自适应学习率耦合——大梯度参数的有效学习率小,权重衰减也被缩小,导致正则化效果不均匀。不同参数受到的正则化强度实际不同。
  2. 解耦方案:AdamW(Loshchilov & Hutter, 2019)将权重衰减直接作用于参数(w -= η·λ·w),与梯度步骤完全解耦。所有参数受到相同比例的权重衰减,不受自适应学习率影响。这使权重衰减回归其本意——直接缩小参数值。
  3. 实践设置Transformer/NLP 任务推荐 lr=1e-4~3e-4, weight_decay=0.01,配合 Warmup(学习率线性增长到峰值)和 Cosine Annealing(余弦衰减到最小值)。梯度裁剪(clip_grad_norm)防止梯度爆炸,是 Transformer 训练的必备组件。
  4. 效果:AdamW 在语言模型、视觉 Transformer(ViT)、扩散模型等场景中显著优于原始 Adam。权重衰减的解耦实现提供了更稳定的正则化,配合学习率调度可达到更好的泛化性能。

来源

相关