Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习策略梯度算法优化

TRPO

概述

Schulman et al. (ICML 2015) 提出的信赖域策略优化算法。通过在 KL 散度约束的信赖域内最大化代理目标,提供策略单调改进的理论保证。使用共轭梯度法 + 回溯线搜索求解,计算开销大,是 PPO 的前身。

关键内容

  1. 核心动机:普通梯度上升步长难以控制——步长太小收敛慢,步长太大策略崩溃且难以恢复。根本原因是参数空间小步长对应策略空间大变化(高度非线性)。

  2. 单调改进定理(Kakade & Langford 2002)J(π̃) ≥ L_π(π̃) - C · D_KL^max(π || π̃) 只要最大 KL 散度受约束,策略改进即有单调保证 J(π̃) ≥ J(π)。

  3. 约束优化问题: 最大化代理目标 L_{θ_old}(θ) = E [ (π_θ/π_θ_old) · A^{π_old} ],约束 E_s[KL(π_old || π_θ)] ≤ δ(典型 δ=0.01)。

  4. 求解方法共轭梯度法近似计算 F^{-1}g(F 为 Fisher 信息矩阵),避免 O(n²) 的显式矩阵构造;随后用回溯线搜索找满足约束的最大步长。

  5. 局限性:共轭梯度(10-50次迭代)+ 线搜索计算开销极大;不兼容参数共享的 Actor-Critic;不支持标准 mini-batch SGD;实现极为复杂,逐渐被 PPO 取代。

来源

相关