Type: concept
Confidence: 0.80
Created: 2026-04-16
Updated: 2026-04-16
Tags: 概率论深度学习控制论

控制即推断(Control as Inference)

概述

Todorov(2006)和 Toussaint(2009)分别揭示了最优控制与概率推断之间的深层数学同构——最优控制问题可被重新表述为概率图模型上的推断问题,从而统一了控制、学习和推理三大范式

关键内容

  1. 历史背景:2000 年代最优控制和强化学习之间存在割裂——最优控制需要精确模型但计算复杂度高,强化学习不需要模型但采样效率低。概率图模型和贝叶斯推断在机器学习中繁荣发展。

  2. 核心洞见:控制(从目标出发向前规划行动)和推断(从观测出发向后推断原因)在数学上是等价的。"规划"和"理解"在抽象层面上是同一回事。

  3. 与 Kalman 滤波的联系:Kalman 滤波器(1960)已展示线性控制和线性估计之间的对偶性,但仅限于线性高斯系统。Todorov 和 Toussaint 将这种对偶性推广到非线性、高维的一般性系统。

  4. 哲学意义:与 Helmholtz"感知即推断"思想遥相呼应——正如大脑通过推断理解感官输入,智能体也通过推断规划行动。

  5. 应用:机器人轨迹优化、高自由度机器人规划(30+ 关节)、变分推断在控制中的应用。

来源

相关