强化学习
概述
Sutton 和 Barto 将心理学的试错学习、控制论的最优控制和机器学习的函数逼近三条思想脉络编织成统一的强化学习框架,建立了 Agent 在与环境交互中通过延迟奖励信号学习最优行为策略的完整理论体系。
关键内容
- 三条思想脉络:
- 心理学:Thorndike 效果律(1911)→ Pavlov 条件反射 → Skinner 操作性条件反射 → Rescorla-Wagner 模型(预测误差驱动学习)
- 控制论:Bellman 动态规划 → Pontryagin 最大值原理 → Hamilton-Jacobi-Bellman 方程
-
机器学习:函数逼近、通用逼近定理
-
核心框架:MDP(马尔可夫决策过程)——Agent 在状态 s 下采取动作 a,环境转移到新状态 s' 并给出奖励 r。目标是学习最优策略 π* 最大化累积奖励。
-
神经生物学基础:Schultz 等(1997)发现多巴胺神经元活动与 TD 误差惊人一致,成为计算神经科学最重要的发现之一。
-
影响:AlphaGo、机器人控制、推荐系统、自动驾驶等领域的核心算法基础。
来源
- 18-sutton-barto-rl-introduction — 强化学习导论