Type: concept
Confidence: 0.93
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习深度强化学习

目标网络

概述

目标网络(Target Network)是 DQN 引入的稳定深度 Q-learning 训练的关键机制。通过维护一份与在线网络参数相同但更新频率极低(每 C 步硬拷贝一次)的独立网络来计算 TD 目标值,给目标值一个"稳定的锚点",避免网络自我强化错误、防止训练振荡或发散。

关键内容

  1. 问题本质:标准 Q-learning 中目标值 y_t = r_t + γ max_{a'} Q_θ(s', a') 依赖正在更新的网络参数 θ,导致参数追逐移动目标,形成正反馈振荡或发散。

  2. 解决方案:维护两套网络:

  3. 在线网络 Q_θ:每步梯度更新
  4. 目标网络 Q_{θ̄}:每 C=10,000 步从在线网络硬拷贝(θ̄ ← θ) TD 目标用目标网络计算y_t = r_t + γ max_{a'} Q_{θ̄}(s', a')

  5. 软更新变体:后续算法(DDPG、SAC 等)改用 Polyak 平均软更新 θ̄ ← τθ + (1-τ)θ̄(τ≈0.005),比硬更新更平滑,避免目标值的周期性跳变。

  6. 局限性:目标网络每 C 步才同步,存在 C 步的目标滞后偏差;C 过大目标陈旧,C 过小稳定性下降,需要权衡调参。

  7. 消融实验结论:DQN 论文消融实验表明,去掉目标网络后训练稳定性大幅下降;同时去掉经验回放和目标网络则常常完全发散。

来源

相关