贝尔曼方程
概述
强化学习中价值函数的递归分解方程,由 Richard Bellman 提出。将长期回报分解为即时奖励加折扣未来回报,是 TD 学习和动态规划的数学基础。
关键内容
-
贝尔曼期望方程(Bellman Expectation Equation):
Q^π(s,a) = E_{s'~P} [ R(s,a,s') + γ Σ_{a'} π(a'|s') Q^π(s',a') ]当前状态-动作价值 = 期望即时奖励 + 折扣后的期望未来价值。 -
贝尔曼最优方程(Bellman Optimality Equation):
Q*(s,a) = E_{s'~P} [ R(s,a,s') + γ max_{a'} Q*(s',a') ]最优 Q 函数满足此方程,是 DQN 等 Value-Based 方法的优化目标。 -
时序差分误差(TD Error):贝尔曼方程的单步近似误差:
δ_t = r_t + γ V(s_{t+1}) - V(s_t)TD 误差是 Actor-Critic 方法中 Critic 的训练信号,也是广义优势估计的基础。 -
与动态规划的关系:贝尔曼方程是动态规划中值迭代和策略迭代的理论基础。当转移概率已知时,可直接迭代求解;当未知时,用采样估计(RL)。
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图