A3C
概述
A3C(Asynchronous Advantage Actor-Critic)由 DeepMind 于 ICML 2016 发表(arXiv:1602.01783)。核心洞察:多个并行 Worker 与不同环境实例异步交互,天然产生不相关数据,可替代经验回放解决训练稳定性问题。这使 A3C 无需经验回放缓冲区,同时支持 on-policy 算法和连续动作空间,用 CPU 集群即可达到与 DQN(GPU)相当的 Atari 性能,且训练时间从 8-10 天缩短至约 1 天(16 CPU)。
关键内容
- 异步并行架构:维护全局共享网络(Actor 头 + Critic 头),多个 Worker 各持局部副本,独立与环境交互后计算梯度,异步(lock-free)更新全局参数。每个 Worker 循环:复制全局参数 → 执行 t_max 步 → 计算梯度 → 更新全局。
- n步回报 + 熵正则化:策略梯度 = ∑_t ∇log π(a_t|s_t)·(R_t - V(s_t)) + β·∇H(π),其中 R_t 为 n 步 bootstrapped 回报,熵项(β=0.01)鼓励探索避免策略过早收敛。
- 局限性:梯度陈旧(stale gradients)、on-policy 导致样本低效、对超参数敏感。同步版本 A2C 缓解了训练噪声问题,是现代 PPO 实现的基础。
来源
- raw/assets/RL-Analysis/rl_05_a3c_ddpg_td3_sac.md — Part A:A3C 完整分析
相关
- Actor-Critic方法 — extends
- 经验回放 — contradicts
- 策略梯度定理 — uses
- 广义优势估计 — uses
- DDPG — compares_to
- DeepMind — 作者机构