检查点策略
概述
检查点策略是 Agent Harness 设计中的关键原则,通过可验证的客观状态(而非 Agent 自我报告)来判断任务进度和完成标准,防止过早声明完成并支持从中间点恢复。
关键内容
- 核心原则:
- 不信任自我报告:不依赖 Agent 说"我完成了 X"来判断进度
- 可验证状态:通过客观条件检查来确认任务完成
-
独立验证:每一步结束后的状态可被独立验证
-
验证示例:
python def is_checkpoint_reached(task_state): # 不好:Agent 说"我完成了X" # 好:检查可验证条件 return ( all_tests_pass(task_state) and code_compiles(task_state) and required_files_exist(task_state) ) -
防止过早声明完成:
- 常见失败模式:Agent 在任务未完成时声明完成,尤其在上下文即将用尽时
-
对策:
-
与错误恢复的关系:
- 检查点是错误恢复的基础
- 当 Agent 出错时,Harness 可从最近的检查点恢复
-
避免传统"重启"策略的高成本(用户体验差 + 资源浪费)
-
设计建议:
- 从小任务开始测试检查点逻辑
- 设计可观察的中间状态
- 假设 Agent 会在任意点失败,确保能从该点恢复
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/09_effective_harnesses.md — Effective harnesses for long-running agents
相关
- Agent Harness 运行框架 — part_of(检查点策略是 Harness 的核心组件)
- 初始化-编码循环模式 — uses(初始化 Agent 设定检查点标准)
- 外化进度追踪 — relates_to(进度文件记录检查点状态)
- 错误复合 — prevents(检查点防止错误在多步迭代中积累)