挑选 AI 编码 Agent
初版对比试图罗列每个产品的优势、陷阱、注意事项和偏见,结果虽然详尽,但实用性不高。实际的问题更具体:针对我的工作方式,应该先试哪个工具?什么情况下我会换掉它?
公开数据说明了什么
Terminal-Bench 2.0 在隔离的终端环境中测试多步骤任务。以下是 2026-08-10 快照中的代表性数据:
在这些配置中,Codex 的表现最强。对于重度依赖终端的工作,它是合理的优先选项。但这并不证明 Codex 的 Harness 本身导致了差异:模型、版本、提示词、权限和日期在不同行之间均发生了变化。
Cursor 和 Pi 在该快照中没有条目。Cursor 侧重于 IDE 工作流,而终端基准测试很难衡量这一点。Pi 可以扩展为多种不同的 Harness,因此脱离具体模型和扩展的“Pi”不是一个稳定的测试对象。
这是唯一值得重复的基准测试警告:表格只能缩小候选范围,不能直接决定最终选择。
各工具的价值
这八个工具不必承担同一种角色。Cursor 适合查看 Diff,Codex 或 Claude Code 可以负责终端任务;研究 Harness 本身时可以使用 Pi;OpenCode 强调提供商自由,Copilot CLI 适合以 GitHub 为中心的团队,Aider 则让工作流紧贴 Git。
我会怎么选
- 以终端为主的仓库工作:从 Codex CLI 或 Claude Code 开始。
- 以 IDE 为中心的审查循环:从 Cursor 开始。
- Google 技术栈或超大源码调研:尝试 Gemini CLI。
- 需要切换提供商:尝试 OpenCode。
- 以 GitHub 为中心的工作流:尝试 GitHub Copilot CLI。
- 以 Git 为核心的终端结对编程:尝试 Aider。
- Harness 实验和受控模型对比:使用 Pi。
最终保留在实际仓库中失败成本最低的那个。熟悉度很重要:一个权限和恢复机制可预测的稍弱工具,可能比不符合工作流的基准测试领先者更有用。
用自己的仓库重跑
给真正准备比较的候选同一份干净仓库、同样的预算、权限和任务:
记录任务完成率、实际耗时、模型/Token 成本、人工干预次数、危险操作和清理工作量。仅看通过率会掩盖通常决定工具是否好用的部分。
产品名单会很快变化,这套重跑方法不会。真正值得长期保留的是后者。