Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习深度学习DQN

DQN

概述

DQN(Deep Q-Network)是 DeepMind 于 2013/2015 年发表的深度强化学习奠基算法,将卷积神经网络与 Q-learning 结合,通过经验回放目标网络两项工程创新,首次在 Atari 2600 游戏上从原始像素端到端学习超人类策略,开启深度强化学习的黄金十年。

关键内容

  1. 三大核心挑战与解决方案:数据时序相关 → 经验回放(均匀随机采样);目标值不稳定 → 目标网络(每 C=10,000 步硬更新);奖励尺度差异 → 奖励裁剪至 [-1,1]。

  2. 网络架构(Nature DQN 2015):输入 84×84×4(连续4帧灰度图),经三层卷积(32/64/64 filters,stride 4/2/1)+ FC 512 → 输出 |A| 个 Q 值,一次前向传播获得所有动作的 Q 值。

  3. TD 目标:使用目标网络计算 y_t = r_t + γ · max_{a'} Q_{θ̄}(s', a'),Huber loss + RMSProp(lr=2.5e-4)更新在线网络;ε 从 1.0 线性衰减到 0.1(前 100 万步)。

  4. 实验结果(49 款 Atari 游戏):29/49 超越人类;Breakout 超人类 1293%,Boxing 1775%;Montezuma's Revenge 因稀疏奖励完全失败(0分)。

  5. 消融实验:去掉目标网络经验回放均显著降低性能,两者同时去掉则常常发散。

  6. 核心缺陷:Q 值过估计(max 操作引入正偏差)→ Double DQN;均匀采样低效 → 优先经验回放;无价值分解 → Dueling DQN;六大改进集成 → Rainbow(2018)。

  7. 工程遗产:确立的范式(深度网络函数逼近 + 经验回放缓冲区 + 目标网络 + ε-greedy + 奖励归一化)被几乎所有后续 off-policy 深度 RL 算法继承。

来源

相关