Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习数学动态规划

贝尔曼方程

概述

强化学习价值函数的递归分解方程,由 Richard Bellman 提出。将长期回报分解为即时奖励加折扣未来回报,是 TD 学习和动态规划的数学基础。

关键内容

  1. 贝尔曼期望方程(Bellman Expectation Equation): Q^π(s,a) = E_{s'~P} [ R(s,a,s') + γ Σ_{a'} π(a'|s') Q^π(s',a') ] 当前状态-动作价值 = 期望即时奖励 + 折扣后的期望未来价值。

  2. 贝尔曼最优方程(Bellman Optimality Equation): Q*(s,a) = E_{s'~P} [ R(s,a,s') + γ max_{a'} Q*(s',a') ] 最优 Q 函数满足此方程,是 DQN 等 Value-Based 方法的优化目标。

  3. 时序差分误差(TD Error):贝尔曼方程的单步近似误差: δ_t = r_t + γ V(s_{t+1}) - V(s_t) TD 误差是 Actor-Critic 方法中 Critic 的训练信号,也是广义优势估计的基础。

  4. 动态规划的关系:贝尔曼方程是动态规划中值迭代和策略迭代的理论基础。当转移概率已知时,可直接迭代求解;当未知时,用采样估计(RL)。

  5. 函数逼近挑战:用神经网络逼近 Q 函数时,贝尔曼方程不再保证收敛,这是 DQN 引入经验回放目标网络的根本原因。

来源

相关