轨迹压缩
概述
RL 训练中将 Agent 执行任务的完整轨迹去除冗余输出、保留关键决策节点的压缩技术,提升训练数据效率。
关键内容
- 目的:Agent 执行任务时产生的完整轨迹包含大量冗余的工具调用输出,直接用于 RL 训练成本高且效率低,压缩后保留关键决策节点
- 压缩策略:去除冗余的工具调用输出,保留关键决策节点(observation, action, reward 三元组),压缩为训练效率更高的格式
- 在训练流程中的位置:批量运行 Agent(batch_runner.py)→ 记录完整轨迹 → 轨迹压缩(trajectory.py)→ Atropos RL 训练 → 策略蒸馏
- 命令行使用:
hermes batch compress --input trajectories/ --output compressed_trajectories/ --max-tokens 4096 - 与 RL 训练的关系:压缩后的轨迹作为 Atropos RL 环境的输入数据,通过 PPO/GRPO 等 RL 算法学习更优的工具调用策略
- 策略蒸馏:改进后的策略最终蒸馏回模型权重,发布新版本 Hermes 模型,在工具调用基准上超越前代
来源
- 06_hermes_learning_loop.md — Hermes Agent 深度解析系列第六篇:闭环学习引擎