Type: concept
Confidence: 0.93
Created: 2026-04-16
Updated: 2026-04-16
Tags: 强化学习深度强化学习

经验回放

概述

经验回放(Experience Replay)是深度强化学习的核心工程技术,由 Lin(1992)提出、DQN 系统化应用。将智能体与环境交互产生的 transition 存入固定容量的回放缓冲区,训练时均匀随机采样 mini-batch,从而打破时序相关性、提升样本效率,是 off-policy 方法的标配机制。

关键内容

  1. 机制:回放缓冲区 D 存储 (s, a, r, s', done) transition,容量 N=1,000,000;训练时均匀随机采样 batch size=32 条进行梯度更新。

  2. 为什么有效

  3. 打破时序相关:连续帧之间高度相关,随机采样消除这种相关性,满足 i.i.d. 假设
  4. 数据复用:每条 transition 可被多次使用,大幅提升样本效率
  5. 分布平滑:采样覆盖历史经验,减小当前策略引起的数据分布漂移

  6. 代价与限制:只适用于 off-policy 方法(Q-learning 天然满足);on-policy 方法(SARSA、PPO 等)不能使用,因为需要当前策略产生的数据。

  7. 改进方向:均匀采样忽略 transition 的重要性差异 → 优先经验回放Prioritized Experience Replay)按 TD 误差加权采样;容量固定且队列式替换导致旧数据被淘汰。

  8. 工程细节:DQN 原版采用前 50,000 步预热(只收集不训练)填充缓冲区后才开始训练,避免初期数据过于稀少。

来源

相关