跳到主要内容

本地编码智能体模型

候选快照

数据核验时间:2026-08-10。目前尚无公认“最佳本地编码模型”。实际表现取决于具体的量化方案、推理运行时、Prompt 模板、上下文长度及 Harness 配置。

候选事实与假设​

候选模型发布形态建议测试场景主要风险/未知项
Qwen3-4B4B 稠密模型;原生 32K 上下文;支持思考模式切换低显存环境下的检索、分类、简单代码编辑容量限制、重复生成、结构化调用稳定性
DeepSeek-R1-Distill-Qwen-7B7B 稠密推理蒸馏模型故障诊断、算法逻辑推理输出长度波动大、依赖特定 Prompt、工具集成难度
gpt-oss-20b总参 21B/激活 3.6B MoE;MXFP4 量化;可配置推理16 GB 显存级别的本地 Agent 实验Harmony 支持情况、KV Cache 剩余空间、任务质量
Qwen3-Coder-30B-A3B-Instruct总参 30.5B/激活 3.3B MoE;原生 256K 上下文;非思考模式24 GB 显存级别的量化实现与工具调用测试全量权重驻留压力、长上下文内存占用、编辑可靠性

注意:“建议测试场景”是基于经验的推断,并非模型卡上的官方声明。MoE 的“激活参数”仅描述单 Token 计算量,不会减少模型文件的总权重体积。

选型维度​

下载前,先明确任务目标,并按以下维度评估候选模型:

  • 补丁与工具调用有效性:生成的 Patch 是否可直接应用?Tool Call 格式是否合法?
  • 语言覆盖度:是否支持仓库中的主要语言,而非仅 Python?
  • 稳定性:多次运行中,结果被接受的比例(Acceptance Rate)。
  • 资源开销:延迟、峰值内存、CPU Offload 需求、可用上下文长度。
  • 许可证合规:针对具体模型文件(Artifact)的许可证及下游分发义务。
  • 运行时兼容性:所选推理引擎是否支持该模型的 Chat/Reasoning 格式。
  • 行为特征:多语言表现及与工作流相关的安全/拒绝行为。

核心原则:Benchmark 高分无法弥补 Harness 无法解析的输出格式问题。

基于角色的路由策略​

  • 小模型(Compact Model):用于低后果、可外部验证的步骤,如文件分类、查询生成、日志精简、单文件机械式编辑。
  • 大模型(Quantized Large Model):用于有边界的实现或代码审查。
  • 测试隔离:保持测试环境独立。
  • 升级机制:涉及架构设计、安全敏感操作、陌生 API 或重复出现的错误签名时,升级至更强模型或人工处理。

多模型协作注意:不要将前一个模型未经验证的断言直接传递给下一个模型。在任务日志(Task Ledger)中保留证据链和不确定性标记。

交给统一评测协议​

本页只维护带日期的候选短名单和角色假设。真正进入选型的候选统一使用本地模型评测协议,不在这里另建一套复测清单。

覆盖范围与偏差说明​

本清单偏好具备公开技术文档、主流消费级运行时支持且定位为 Coding/Agent 的模型。它排除了大量通用模型、特定语言模型、多模态模型、微调模型及新发布模型。此外,该清单基于终端工作流和消费级 NVIDIA 显存层级(如 16GB/24GB)制定。未列入清单不代表模型性能差。

厂商 Benchmark 和模型卡仅作为候选证据。最终采用前,必须通过与托管基线相同的私有重放协议进行验证。

探索关联打开关联网络