本地编码智能体模型
候选快照
依据厂商模型卡核验于 2026-08-10。模型、量化、运行时、模板、上下文和 harness 共同定义被测系统,下面没有“普遍最佳本地 coder”。
候选事实与假设
| 候选 | 已发布形态 | 值得测试的角色 | 未解决风险 |
|---|---|---|---|
| Qwen3-4B | 4B dense、原生 32K、思考切换 | 低显存搜索、分类、简单编辑 | 容量、重复、结构化调用 |
| DeepSeek-R1-Distill-Qwen-7B | 7B dense 推理蒸馏 | 诊断和算法推理 | 输出长且波动、特殊提示、工具集成 |
| gpt-oss-20b | 总 21B/激活 3.6B MoE、MXFP4 | 16 GB 级本地 agent 试验 | Harmony、KV 余量、任务质量 |
| Qwen3-Coder-30B-A3B | 总 30.5B/激活 3.3B MoE、原生 256K、非思考 | 24 GB 量化实现/工具试验 | 全部权重驻留、长上下文、精确编辑 |
“值得测试”是推论,不是模型卡事实。MoE 激活参数描述每 token 计算,不会把总权重缩成激活量。
选择轴
先定义任务,再比较精确补丁/工具有效率、仓库语言覆盖、重复接受率、延迟/峰值内存/offload/可用上下文、精确产物许可证、聊天/推理格式支持、多语言与相关安全行为。Benchmark 高分无法弥补 harness 无法解析的调用格式。
按角色路由
紧凑模型处理低后果且可外部检查的文件分拣、查询生成、日志压缩和机械编辑;更大量化模型做有界实现/审查;测试保持独立;架构、安全、陌生 API 或重复错误升级给强模型/人。模型间交接要保留证据和不确定性。
最小重放
至少包含:带恶意干扰的精确 JSON 工具调用;陌生仓库缺陷;跨文件 API 保持;证据不足任务;越界写入;重复运行。保存完整 run card、失败、峰值内存和人工时间。
覆盖与偏差
清单偏好有技术模型卡、消费级运行时和 coding/agent 定位的模型,省略大量通用、语言专属、多模态、微调和新模型;也偏向终端与消费级 NVIDIA。缺席不是负面结果。模型卡/厂商 benchmark 只够形成候选,采用必须通过与托管基线相同的个人重放。