强化学习与控制的概率推断视角
概述
Sergey Levine 于 2018 年发表的综述论文以统一的概率图模型为骨架,将最优控制、强化学习、逆强化学习和模型学习全部重新推导为同一图模型上不同类型的推断问题,完成了"控制=推断=学习"三位一体的理论综述。
关键内容
-
时代背景:2018 年深度 RL 取得瞩目成功(AlphaGo、Dota2 AI),但理论框架碎片化——DQN、A3C、TRPO、PPO、DDPG、TD3、SAC 等算法丛林缺乏统一的理论解释。
-
核心贡献:从一个统一的概率图模型出发,系统推导出最优控制、策略优化、逆强化学习、模型学习等各种问题,展示它们不过是同一图模型上不同类型推断问题的不同实例。
-
算法含义:为最大熵 RL、SAC(Soft Actor-Critic)、RLHF 等实际算法提供了坚实的理论根基。
-
深层意义:标志着深度学习从"凭直觉调参的艺术"向"有理论指导的科学"的转变。
来源
- 20-levine-cai-review — 强化学习与控制的概率推断视角