单卡本地模型
“单卡能跑”可能只表示带 CPU offload 加载、短请求完成,或有实用上下文且速度可交互;三 者不同。
内存预算
原始权重 GiB ≈ 参数量 × 每权重 bit ÷ 8 ÷ 2^30
名义 7B 的 4-bit 原始权重约 3.3 GiB,24B 约 11.2 GiB。实际还包括量化元数据、未量化张量、allocator/workspace 和运行时 buffer。
KV cache 随层数、KV width、序列、精度和 batch 增长:
KV bytes ≈ 2 × layers × KV width × sequence × bytes × batch
具体模型必须用架构计算器或运行时实测;宣布 fit 前预留输出和并发。MoE 激活参数估算每 token 计算,总专家仍贡献权重存储。
起始档位,不是保证
| 可用 VRAM | 合理首试 | 常见妥协 |
|---|---|---|
| 8 GB | 3–4B 4/5-bit;部分短上下文 7B | 容量、上下文或 offload |
| 12 GB | 量化 7–8B;谨慎 12–14B | 上下文和速度余量 |
| 16 GB | 量化 12–14B;受支持 gpt-oss-20b MXFP4 | 模板/KV/运行时限制 |
| 24 GB | 量化 20–24B;部分 30B MoE | 长上下文和并发压力 |
CPU offload 扩大放置空间,不扩大 VRAM,并可能让 agent loop 慢到不可用。
候选事实
- Qwen3-4B: 4B、原生 32K、思考切换;模型卡警告思考模式贪心解码可能退化/重复。
- Phi-4-mini-instruct: 3.8B、标称 128K;官方明确提醒事实容量有限且代码偏 Python。
- gpt-oss-20b: 总 21B/激活 3.6B;OpenAI 称 MXFP4 可在 16 GB 内运行并要求 Harmony。
- Mistral Small 3.1 24B: 官方称量化可装 RTX 4090/32 GB Mac,而 BF16 约需 55 GB;精度是内存声明的一部分。
这些事实只形成候选,不形成质量排名。
Fit 流程
定义任务、并发、上下文、输出和延迟;选精确产物并算原始权重;确认模板/运行时;从短原生上下文和并发 1 开始;测峰值 VRAM/RAM、offload、首 token、decode 和接受结果;独立增加上下文;保留 10–20% 运维余量。