Actor-Critic方法
概述
Actor-Critic(演员-评论家)方法是强化学习中结合策略梯度(Actor)与价值函数估计(Critic)的混合架构。Actor 负责选择动作,Critic 负责评估当前策略的价值,用于降低策略梯度的方差。相比纯策略梯度方法,AC 通过 Critic 提供基线,减少估计噪声;相比纯价值方法,AC 直接优化策略,天然支持连续动作空间。现代深度强化学习中绝大多数 SOTA 方法(A3C、DDPG、TD3、SAC、PPO)均属于 Actor-Critic 家族。
关键内容
- 架构分工:Actor 网络参数化策略 π_θ(a|s),Critic 网络估计价值函数 V_φ(s) 或 Q_φ(s,a);Actor 用 Critic 的输出计算优势函数指导更新方向。
- 优势函数:A(s,a) = Q(s,a) - V(s),衡量某动作相对于平均水平的优劣,作为策略梯度的权重,替代原始回报以降低方差。
- 演化路线:A3C(异步并行)→ DDPG(确定性策略 + 经验回放)→ TD3(双 Critic + 延迟更新)→ SAC(最大熵框架),每代解决前代的核心缺陷。
来源
- raw/assets/RL-Analysis/rl_05_a3c_ddpg_td3_sac.md — Actor-Critic Methods 完整分析(A3C/DDPG/TD3/SAC)