Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习Actor-Critic确定性策略连续控制深度强化学习

DDPG

概述

DDPG(Deep Deterministic Policy Gradient)由 DeepMindICLR 2016 发表(arXiv:1509.02971)。核心贡献:将 DQN 的经验回放目标网络引入连续动作空间,结合确定性策略梯度定理(DPG,Silver et al. 2014),首次实现连续控制任务的端到端深度强化学习。确定性策略 a=μ_θ(s) 避免了 DQN 在连续空间中的 argmax 不可行问题,OU 噪声提供探索。软目标网络更新(τ=0.005)比 DQN 的硬复制更稳定。

关键内容

  1. 四网络结构:在线 Actor μ_θ、目标 Actor μ_θ̄、在线 Critic Q_φ、目标 Critic Q_φ̄。Critic 计算 TD 目标:y = r + γ·Q_φ̄(s', μ_θ̄(s'));Actor 最大化期望 Q 值:∇J = ∇a Q_φ(s,a)|{a=μ_θ(s)} · ∇_θ μ_θ(s)。目标网络软更新:θ̄ ← τθ + (1-τ)θ̄。
  2. OU 噪声探索:确定性策略无内在随机性,通过 Ornstein-Uhlenbeck 过程添加时间相关噪声 dN = θ(μ-N)dt + σdW,适合物理控制;实践中也常用简单高斯噪声。
  3. 主要缺陷:Critic 系统性过估计 Q 值(比真实值高 200-600%),Actor 利用过估计区域形成正反馈循环,训练不稳定,OU 噪声超参数难调。这些问题由 TD3 系统性修复。

来源

相关