端到端视觉运动学习
概述
端到端视觉运动学习是让机器人直接从原始摄像头像素映射到关节力矩的深度学习范式,绕过传统的感知-状态估计-规划-控制模块化流水线,用统一的神经网络联合优化感知与控制。由 Levine 等人于 2016 年首次在真实机器人上实现。
关键内容
核心创新:打破感知-控制边界
传统机器人操作流水线:
图像 → 特征提取 → 位姿估计 → 运动规划 → 控制器 → 力矩
(每步手工设计、分别优化、接口人为定义)
端到端方法:
图像 + 关节状态 → 深度神经网络 → 关节力矩
(统一优化,自动发现最优中间表示)
关键价值:网络自动学习"什么视觉信息对控制最有用",而非使用预定义的位姿参数。实验发现,网络自动关注任务相关的特征点(瓶盖边缘、插孔角点)而非人类预设的参数。
引导策略搜索(Guided Policy Search, GPS)
端到端学习的核心挑战:真实机器人数据极昂贵,不能像 DQN 那样用百万次探索。GPS 的解决方案——"分而治之":
- 轨迹优化阶段(小样本、高效):在低维状态空间(关节角度)用 iLQG 生成高质量轨迹。不用视觉,只用精确传感器。
- 策略优化阶段(监督学习):以轨迹优化结果为监督标签,训练从图像→力矩的深度网络(行为克隆)。
- 两阶段交替:轨迹优化约束不偏离当前策略(KL 散度约束),策略逐步接管视觉决策。
效率对比:DQN 需数百万次交互;GPS 每任务仅需约 20-30 分钟真实机器人交互。
空间软注意力层(Spatial Softmax)
关键架构创新,解决卷积特征图到控制的空间推理问题:
传统 CNN 池化:丢失空间位置信息("有没有物体"≠"物体在哪里")
Spatial Softmax:对每个特征图施加 softmax,计算期望坐标 (x̄, ȳ)
→ 可微分的软 argmax
→ 保留每个特征的最强响应位置
→ 侧向抑制噪声(只保留强激活)
效果:将高维像素特征图压缩为语义坐标,减少过拟合,提升对视觉干扰的鲁棒性。被后续大量视觉运动学习工作采用为标准组件。
历史意义
- 2016 年与 AlphaGo 同年:标志深度学习从"识别模式"进入"物理世界决策"
- 直接催生 Google 机器人农场 → RT-1 → RT-2 技术路线
- 触发 sim-to-real 研究热潮(深度学习下真实数据不足的回应)
- Chelsea Finn 的元学习(MAML)直接从此出发
来源
- raw/books/机器人学/14-levine-deep-visuomotor-policies.md
相关
- 视觉-语言-动作模型 — 端到端视觉运动学习的大规模演进形态
- 域随机化 — 解决端到端学习的仿真数据不足问题
- Sergey-Levine — 主要提出者