经验回放
概述
经验回放(Experience Replay)是深度强化学习的核心工程技术,由 Lin(1992)提出、DQN 系统化应用。将智能体与环境交互产生的 transition 存入固定容量的回放缓冲区,训练时均匀随机采样 mini-batch,从而打破时序相关性、提升样本效率,是 off-policy 方法的标配机制。
关键内容
-
机制:回放缓冲区 D 存储 (s, a, r, s', done) transition,容量 N=1,000,000;训练时均匀随机采样 batch size=32 条进行梯度更新。
-
为什么有效:
- 打破时序相关:连续帧之间高度相关,随机采样消除这种相关性,满足 i.i.d. 假设
- 数据复用:每条 transition 可被多次使用,大幅提升样本效率
-
分布平滑:采样覆盖历史经验,减小当前策略引起的数据分布漂移
-
代价与限制:只适用于 off-policy 方法(Q-learning 天然满足);on-policy 方法(SARSA、PPO 等)不能使用,因为需要当前策略产生的数据。
-
改进方向:均匀采样忽略 transition 的重要性差异 → 优先经验回放(Prioritized Experience Replay)按 TD 误差加权采样;容量固定且队列式替换导致旧数据被淘汰。
-
工程细节:DQN 原版采用前 50,000 步预热(只收集不训练)填充缓冲区后才开始训练,避免初期数据过于稀少。
来源
- rl_01_dqn — V-01 DQN 完整分析,经验回放机制详解