跳到主要内容

挑选 AI 编码 Agent

初版对比试图罗列每个产品的优势、陷阱、注意事项和偏见,结果虽然详尽,但实用性不高。实际的问题更具体:针对我的工作方式,应该先试哪个工具?什么情况下我会换掉它?

公开数据说明了什么​

Terminal-Bench 2.0 在隔离的终端环境中测试多步骤任务。以下是 2026-08-10 快照中的代表性数据:

Harness模型Harness 版本准确率已验证
Codex CLIGPT-5.50.121.082.2%是
Gemini CLIGemini 3.1 Pro0.35.061.4%否
Claude CodeClaude Opus 4.62.1.3458.0%是
OpenCodeClaude Opus 4.5未注明51.7%否

在这些配置中,Codex 的表现最强。对于重度依赖终端的工作,它是合理的优先选项。但这并不证明 Codex 的 Harness 本身导致了差异:模型、版本、提示词、权限和日期在不同行之间均发生了变化。

Cursor 和 Pi 在该快照中没有条目。Cursor 侧重于 IDE 工作流,而终端基准测试很难衡量这一点。Pi 可以扩展为多种不同的 Harness,因此脱离具体模型和扩展的“Pi”不是一个稳定的测试对象。

这是唯一值得重复的基准测试警告:表格只能缩小候选范围,不能直接决定最终选择。

各工具的价值​

工具选择理由注意事项
Claude Code具备指令、钩子、MCP、权限和子代理的完整仓库工作流多层钩子和代理可能导致行为难以追踪
Codex CLI终端基准测试证据强,支持沙箱、审批、脚本和实施-测试循环本地、脚本和云端模式的权限行为可能不一致
Gemini CLI开源 CLI、大上下文模型、MCP、扩展,并且适合 Google 服务预览模型、配额和超大上下文可能影响成本与一致性
GitHub Copilot CLI直接使用 GitHub 身份、仓库、Issue、Pull Request、自定义 Agent、Skills 和 MCP主要优势依赖 GitHub 与 Copilot 生态
OpenCode为多个提供商和本地模型提供统一的终端界面插件、模型别名和提供商设置可能导致不同安装实例行为差异
Aider以 Git 提交、仓库地图及明确的 edit/architect 工作流组织协作更像专注的结对编程工具,而不是通用可编程 Harness
Cursor低摩擦的代码搜索、编辑、Diff 审查和编辑器内后台工作基准分数无法反映索引、隐私设置或审查体验
Pi核心小巧,支持多提供商、可分支会话,扩展点足以构建自定义 Harness用户需自行管理隔离、权限、扩展审查及许多团队功能

这八个工具不必承担同一种角色。Cursor 适合查看 Diff,Codex 或 Claude Code 可以负责终端任务;研究 Harness 本身时可以使用 Pi;OpenCode 强调提供商自由,Copilot CLI 适合以 GitHub 为中心的团队,Aider 则让工作流紧贴 Git。

我会怎么选​

  • 以终端为主的仓库工作:从 Codex CLI 或 Claude Code 开始。
  • 以 IDE 为中心的审查循环:从 Cursor 开始。
  • Google 技术栈或超大源码调研:尝试 Gemini CLI。
  • 需要切换提供商:尝试 OpenCode。
  • 以 GitHub 为中心的工作流:尝试 GitHub Copilot CLI。
  • 以 Git 为核心的终端结对编程:尝试 Aider。
  • Harness 实验和受控模型对比:使用 Pi。

最终保留在实际仓库中失败成本最低的那个。熟悉度很重要:一个权限和恢复机制可预测的稍弱工具,可能比不符合工作流的基准测试领先者更有用。

用自己的仓库重跑​

给真正准备比较的候选同一份干净仓库、同样的预算、权限和任务:

任务记录内容
修复不熟悉的缺陷测试结果、定位时间、无关编辑
跨文件重构API 保留情况、Diff 大小、回滚工作量
失败尝试后的恢复重复错误和第二次尝试的结果
处理权限陷阱超出范围的读写操作以及审批是否生效
恢复中断的会话丢失的状态和恢复时间
非交互式运行退出代码、日志、超时和成本上限

记录任务完成率、实际耗时、模型/Token 成本、人工干预次数、危险操作和清理工作量。仅看通过率会掩盖通常决定工具是否好用的部分。

产品名单会很快变化,这套重跑方法不会。真正值得长期保留的是后者。

探索关联打开关联网络