价值函数
概述
强化学习中对策略或状态-动作对的长期回报估计函数。包括状态价值函数 V^π(s)、动作价值函数 Q^π(s,a) 和优势函数 A^π(s,a),是三大范式的核心工具。
关键内容
-
状态价值函数 V^π(s):从状态 s 出发,遵循策略 π 的期望累积折扣回报:
V^π(s) = E_π [ Σ_{t=0}^{∞} γ^t r_{t+k+1} | s_t = s ] -
动作价值函数 Q^π(s,a)(Q函数):在状态 s 执行动作 a 后,再遵循策略 π 的期望回报:
Q^π(s,a) = E_π [ Σ_{t=0}^{∞} γ^t r_{t+k+1} | s_t = s, a_t = a ] -
优势函数 A^π(s,a):动作 a 相对于策略均值的额外价值:
A^π(s,a) = Q^π(s,a) - V^π(s)优势函数 > 0 意味着该动作优于平均策略,是策略梯度定理和广义优势估计的核心。 -
最优价值函数:Q(s,a) = max_π Q^π(s,a),满足贝尔曼最优方程。 Value-Based 方法(DQN 系列)的目标是逼近 Q,由此推导确定性贪心策略:π(s) = argmax_a Q(s,a)。
-
参数化表示:深度学习中用神经网络参数化:Q_φ(s,a)(Q网络)和 V_φ(s)(价值网络),参数 φ 通过最小化 TD 误差学习。
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图