Type: concept
Confidence: 0.90
Created: 2026-04-18
Updated: 2026-04-20
Tags: 机器学习深度学习优化优化器

Momentum(动量)

概述 (50-200字符)

Momentum 为梯度下降引入"惯性"——梯度的指数移动平均。方向一致时加速,方向震荡时减速,有效加速收敛并抑制噪声。是 Adam 优化器的一阶矩组件。

关键内容 (≥300字符, 用双链)

  1. 算法:mₜ = β·mₜ₋₁ + (1-β)·gₜ,θ ← θ - η·mₜ。其中 β 通常取 0.9,意味着当前更新 90% 来自历史动量、10% 来自当前梯度。一阶矩 mₜ 是梯度的指数移动平均(Exponential Moving Average, EMA)。
  2. 直觉类比:如同一个球在碗里滚动。当梯度方向一致时,动量持续累积,步子越迈越大(加速收敛);当梯度方向震荡时(如损失曲面的狭长峡谷),正负动量相互抵消,步子缩小(抑制震荡)。这使 Momentum 能穿越梯度消失区域和鞍点(Saddle Point)
  3. 在 Adam 中的角色Adam(自适应矩估计)将 Momentum 作为一阶矩组件(β₁=0.9),与RMSProp的二阶矩结合,同时获得动量加速和自适应学习率的优势。Adam 的偏差修正机制专门解决了 Momentum 初始化时 m₀=0 导致的早期低估问题。
  4. 与 SGD 对比:SGD+Momentum 在 CNN(如 ImageNet 分类)训练中通常优于 Adam,能达到更好的最终精度。这是因为自适应学习率在训练末期可能引入不必要的震荡,而固定学习率配合动量有更稳定的收敛行为。

来源

相关