跳到主要内容

Agent Harness

模型提出下一步,harness 让这一步能够执行、有边界、可观察并可恢复。

最小职责

职责
循环在模型回合、工具调用、结果和停止条件之间推进
上下文选择指令、历史、文件和检索证据
工具验证参数、执行调用、返回结构化结果
策略执行范围、权限、审批、预算与安全边界
状态保存任务进度、产物和可恢复检查点
可靠性超时、重试、幂等、取消和失败报告
可观测性trace、日志、token/成本与工具证据
评估用代表性任务检查结果质量

只循环到模型说“完成”,只能算有编排,还不能算可靠的 harness。

实践顺序

  1. 先定义结果和外部可检查的成功标准。
  2. 只暴露最小有用工具集。
  3. 区分只读、写入和不可逆动作。
  4. 让产物与证据脱离对话记录独立保存。
  5. 设置时间、token、重试和并发上限。
  6. 追踪模型回合和工具调用,并控制敏感数据。
  7. 更换默认模型或推理强度前,重放个人代表性任务。

质量门由 harness 持有,模型只是可替换组件。更强模型可能减少重试,却不会取消证据、权限和端到端检查的必要性。因此模型选择放在带日期的模型与 API 雷达中。