马尔可夫决策过程
概述
强化学习的标准数学形式化。MDP 是五元组 (S, A, P, R, γ),描述智能体与环境交互的完整框架,目标是学习策略 π 最大化期望累积折扣回报 J(π)。
关键内容
- 五元组定义:
- S:状态空间(环境所有可能状态集合)
- A:动作空间(智能体可执行动作集合)
- P(s'|s,a):转移概率(状态 s 执行动作 a 后转移至 s' 的概率)
- R(s,a,s'):奖励函数(状态转移后的即时奖励)
-
γ ∈ [0,1):折扣因子(未来奖励的折现率)
-
优化目标:找到策略 π 使期望累积折扣回报最大化:
J(π) = E_π [ Σ_{t=0}^{∞} γ^t R(s_t, a_t, s_{t+1}) ] -
马尔可夫性质:未来状态只依赖当前状态和动作,与历史无关,即 P(s_{t+1}|s_t,a_t,s_{t-1},...) = P(s_{t+1}|s_t,a_t)。
-
折扣因子 γ 的作用:γ→0 时智能体只关注即时奖励;γ→1 时等权重考虑所有未来奖励。实际中 γ ∈ [0.9, 0.99]。
来源
- raw/assets/RL-Analysis/rl_00_overview — 强化学习核心范式:系统性论文分析路线图