目标网络
概述
目标网络(Target Network)是 DQN 引入的稳定深度 Q-learning 训练的关键机制。通过维护一份与在线网络参数相同但更新频率极低(每 C 步硬拷贝一次)的独立网络来计算 TD 目标值,给目标值一个"稳定的锚点",避免网络自我强化错误、防止训练振荡或发散。
关键内容
-
问题本质:标准 Q-learning 中目标值
y_t = r_t + γ max_{a'} Q_θ(s', a')依赖正在更新的网络参数 θ,导致参数追逐移动目标,形成正反馈振荡或发散。 -
解决方案:维护两套网络:
- 在线网络 Q_θ:每步梯度更新
-
目标网络 Q_{θ̄}:每 C=10,000 步从在线网络硬拷贝(θ̄ ← θ) TD 目标用目标网络计算:
y_t = r_t + γ max_{a'} Q_{θ̄}(s', a') -
软更新变体:后续算法(DDPG、SAC 等)改用 Polyak 平均软更新
θ̄ ← τθ + (1-τ)θ̄(τ≈0.005),比硬更新更平滑,避免目标值的周期性跳变。 -
局限性:目标网络每 C 步才同步,存在 C 步的目标滞后偏差;C 过大目标陈旧,C 过小稳定性下降,需要权衡调参。
来源
- rl_01_dqn — V-01 DQN 完整分析,目标网络机制详解及消融实验
相关
- DQN — part_of
- 强化学习 — extends