本地编码智能体模型
候选快照
数据核验时间:2026-08-10。目前尚无公认“最佳本地编码模型”。实际表现取决于具体的量化方案、推理运行时、Prompt 模板、上下文长度及 Harness 配置。
候选事实与假设
注意:“建议测试场景”是基于经验的推断,并非模型卡上的官方声明。MoE 的“激活参数”仅描述单 Token 计算量,不会减少模型文件的总权重体积。
选型维度
下载前,先明确任务目标,并按以下维度评估候选模型:
- 补丁与工具调用有效性:生成的 Patch 是否可直接应用?Tool Call 格式是否合法?
- 语言覆盖度:是否支持仓库中的主要语言,而非仅 Python?
- 稳定性:多次运行中,结果被接受的比例(Acceptance Rate)。
- 资源开销:延迟、峰值内存、CPU Offload 需求、可用上下文长度。
- 许可证合规:针对具体模型文件(Artifact)的许可证及下游分发义务。
- 运行时兼容性:所选推理引擎是否支持该模型的 Chat/Reasoning 格式。
- 行为特征:多语言表现及与工作流相关的安全/拒绝行为。
核心原则:Benchmark 高分无法弥补 Harness 无法解析的输出格式问题。
基于角色的路由策略
- 小模型(Compact Model):用于低后果、可外部验证的步骤,如文件分类、查询生成、日志精简、单文件机械式编辑。
- 大模型(Quantized Large Model):用于有边界的实现或代码审查。
- 测试隔离:保持测试环境独立。
- 升级机制:涉及架构设计、安全敏感操作、陌生 API 或重复出现的错误签名时,升级至更强模型或人工处理。
多模型协作注意:不要将前一个模型未经验证的断言直接传递给下一个模型。在任务日志(Task Ledger)中保留证据链和不确定性标记。
交给统一评测协议
本页只维护带日期的候选短名单和角色假设。真正进入选型的候选统一使用本地模型评测协议,不在这里另建一套复测清单。
覆盖范围与偏差说明
本清单偏好具备公开技术文档、主流消费级运行时支持且定位为 Coding/Agent 的模型。它排除了大量通用模型、特定语言模型、多模态模型、微调模型及新发布模型。此外,该清单基于终端工作流和消费级 NVIDIA 显存层级(如 16GB/24GB)制定。未列入清单不代表模型性能差。
厂商 Benchmark 和模型卡仅作为候选证据。最终采用前,必须通过与托管基线相同的私有重放协议进行验证。