Type: concept
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习数学

价值函数

概述

强化学习中对策略或状态-动作对的长期回报估计函数。包括状态价值函数 V^π(s)、动作价值函数 Q^π(s,a) 和优势函数 A^π(s,a),是三大范式的核心工具。

关键内容

  1. 状态价值函数 V^π(s):从状态 s 出发,遵循策略 π 的期望累积折扣回报: V^π(s) = E_π [ Σ_{t=0}^{∞} γ^t r_{t+k+1} | s_t = s ]

  2. 动作价值函数 Q^π(s,a)(Q函数):在状态 s 执行动作 a 后,再遵循策略 π 的期望回报: Q^π(s,a) = E_π [ Σ_{t=0}^{∞} γ^t r_{t+k+1} | s_t = s, a_t = a ]

  3. 优势函数 A^π(s,a):动作 a 相对于策略均值的额外价值: A^π(s,a) = Q^π(s,a) - V^π(s) 优势函数 > 0 意味着该动作优于平均策略,是策略梯度定理广义优势估计的核心。

  4. 最优价值函数:Q(s,a) = max_π Q^π(s,a),满足贝尔曼最优方程Value-Based 方法(DQN 系列)的目标是逼近 Q,由此推导确定性贪心策略:π(s) = argmax_a Q(s,a)。

  5. 参数化表示:深度学习中用神经网络参数化:Q_φ(s,a)(Q网络)和 V_φ(s)(价值网络),参数 φ 通过最小化 TD 误差学习。

来源

相关