最大熵强化学习
概述
最大熵强化学习(Maximum Entropy RL)在标准 RL 累积奖励目标中增加策略熵正则项:J(π) = E_π[∑_t r(s_t,a_t) + α·H(π(·|s_t))],其中 α 为温度参数控制探索权重。核心思想:让智能体在最大化奖励的同时最大化策略随机性,使探索成为优化目标的一部分而非外加机制。该框架导出软贝尔曼方程和软策略迭代,SAC 是其最成功的深度 RL 实现。
关键内容
- 软贝尔曼方程:V_soft(s) = E_{a~π}[Q_soft(s,a) - α log π(a|s)] = E[Q] + α·H(π)。熵项被内嵌到价值函数定义中,形成 T^π Q(s,a) = r + γ·E_{s'}[E_{a'~π}[Q(s',a') - α log π(a'|s')]]。
- 四大好处:自动探索(高熵=高随机性=自然探索)、多模式保持(不过早收敛到局部最优)、鲁棒性(随机策略对扰动更鲁棒)、组合迁移能力(高熵策略更易适应新任务)。
- 自动温度调整(SAC v2):将目标熵 H̄ 作为约束自动学习 α,L(α) = E[-α log π - α H̄],连续动作空间取 H̄ = -dim(A)。免去最难调的超参数,实现即插即用的探索-利用平衡。
来源
- raw/assets/RL-Analysis/rl_05_a3c_ddpg_td3_sac.md — Part D:SAC 与最大熵框架分析
相关
- 强化学习 — extends
- 信息熵 — uses
- SAC — implements
- 贝尔曼方程 — extends
- 强化学习与控制的概率推断视角 — relates_to