跳到主要内容

本地编码智能体模型

候选快照

依据厂商模型卡核验于 2026-08-10。模型、量化、运行时、模板、上下文和 harness 共同定义被测系统,下面没有“普遍最佳本地 coder”。

候选事实与假设

候选已发布形态值得测试的角色未解决风险
Qwen3-4B4B dense、原生 32K、思考切换低显存搜索、分类、简单编辑容量、重复、结构化调用
DeepSeek-R1-Distill-Qwen-7B7B dense 推理蒸馏诊断和算法推理输出长且波动、特殊提示、工具集成
gpt-oss-20b总 21B/激活 3.6B MoE、MXFP416 GB 级本地 agent 试验Harmony、KV 余量、任务质量
Qwen3-Coder-30B-A3B总 30.5B/激活 3.3B MoE、原生 256K、非思考24 GB 量化实现/工具试验全部权重驻留、长上下文、精确编辑

“值得测试”是推论,不是模型卡事实。MoE 激活参数描述每 token 计算,不会把总权重缩成激活量。

选择轴

先定义任务,再比较精确补丁/工具有效率、仓库语言覆盖、重复接受率、延迟/峰值内存/offload/可用上下文、精确产物许可证、聊天/推理格式支持、多语言与相关安全行为。Benchmark 高分无法弥补 harness 无法解析的调用格式。

按角色路由

紧凑模型处理低后果且可外部检查的文件分拣、查询生成、日志压缩和机械编辑;更大量化模型做有界实现/审查;测试保持独立;架构、安全、陌生 API 或重复错误升级给强模型/人。模型间交接要保留证据和不确定性。

最小重放

至少包含:带恶意干扰的精确 JSON 工具调用;陌生仓库缺陷;跨文件 API 保持;证据不足任务;越界写入;重复运行。保存完整 run card、失败、峰值内存和人工时间。

覆盖与偏差

清单偏好有技术模型卡、消费级运行时和 coding/agent 定位的模型,省略大量通用、语言专属、多模态、微调和新模型;也偏向终端与消费级 NVIDIA。缺席不是负面结果。模型卡/厂商 benchmark 只够形成候选,采用必须通过与托管基线相同的个人重放。