Agent Harness
模型提出下一步,harness 让这一步能够执行、有边界、可观察并可恢复。
最小职责
| 层 | 职责 |
|---|---|
| 循环 | 在模型回合、工具调用、结果和停止条件之间推进 |
| 上下文 | 选择指令、历史、文件和检索证据 |
| 工具 | 验证参数、执行调用、返回结构化结果 |
| 策略 | 执行范围、权限、审批、预算与安全边界 |
| 状态 | 保存任务进度、产物和可恢复检查点 |
| 可靠性 | 超时、重试、幂等、取消和失败报告 |
| 可观测性 | trace、日志、token/成本与工具证据 |
| 评估 | 用代表性任务检查结果质量 |
只循环到模型说“完成”,只能算有编排,还不能算可靠的 harness。
实践顺序
- 先定义结果和外部可检查的成功标准。
- 只暴露最小有用工具集。
- 区分只读、写入和不可逆动作。
- 让产物与证据脱离对话记录独立保存。
- 设置时间、token、重试和并发上限。
- 追踪模型回合和工具调用,并控制敏感数据。
- 更换默认模型或推理强度前,重放个人代表性任务。
质量门由 harness 持有,模型只是可替换组件。更强模型可能减少重试,却不会取消证据、权限和端到端检查的必要性。因此模型选择放在带日期的模型与 API 雷达中。