Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习Actor-Critic策略梯度深度强化学习

Actor-Critic方法

概述

Actor-Critic演员-评论家)方法是强化学习中结合策略梯度(Actor)与价值函数估计(Critic)的混合架构。Actor 负责选择动作,Critic 负责评估当前策略的价值,用于降低策略梯度的方差。相比纯策略梯度方法,AC 通过 Critic 提供基线,减少估计噪声;相比纯价值方法,AC 直接优化策略,天然支持连续动作空间。现代深度强化学习中绝大多数 SOTA 方法(A3C、DDPG、TD3、SAC、PPO)均属于 Actor-Critic 家族。

关键内容

  1. 架构分工:Actor 网络参数化策略 π_θ(a|s),Critic 网络估计价值函数 V_φ(s) 或 Q_φ(s,a);Actor 用 Critic 的输出计算优势函数指导更新方向。
  2. 优势函数:A(s,a) = Q(s,a) - V(s),衡量某动作相对于平均水平的优劣,作为策略梯度的权重,替代原始回报以降低方差。
  3. 演化路线:A3C(异步并行)→ DDPG(确定性策略 + 经验回放)→ TD3(双 Critic + 延迟更新)→ SAC(最大熵框架),每代解决前代的核心缺陷。

来源

相关