跳到主要内容

单卡本地模型

“单卡能跑”可能只表示带 CPU offload 加载、短请求完成,或有实用上下文且速度可交互;三者不同。

内存预算

原始权重 GiB ≈ 参数量 × 每权重 bit ÷ 8 ÷ 2^30

名义 7B 的 4-bit 原始权重约 3.3 GiB,24B 约 11.2 GiB。实际还包括量化元数据、未量化张量、allocator/workspace 和运行时 buffer。

KV cache 随层数、KV width、序列、精度和 batch 增长:

KV bytes ≈ 2 × layers × KV width × sequence × bytes × batch

具体模型必须用架构计算器或运行时实测;宣布 fit 前预留输出和并发。MoE 激活参数估算每 token 计算,总专家仍贡献权重存储。

起始档位,不是保证

可用 VRAM合理首试常见妥协
8 GB3–4B 4/5-bit;部分短上下文 7B容量、上下文或 offload
12 GB量化 7–8B;谨慎 12–14B上下文和速度余量
16 GB量化 12–14B;受支持 gpt-oss-20b MXFP4模板/KV/运行时限制
24 GB量化 20–24B;部分 30B MoE长上下文和并发压力

CPU offload 扩大放置空间,不扩大 VRAM,并可能让 agent loop 慢到不可用。

候选事实

  • Qwen3-4B: 4B、原生 32K、思考切换;模型卡警告思考模式贪心解码可能退化/重复。
  • Phi-4-mini-instruct: 3.8B、标称 128K;官方明确提醒事实容量有限且代码偏 Python。
  • gpt-oss-20b: 总 21B/激活 3.6B;OpenAI 称 MXFP4 可在 16 GB 内运行并要求 Harmony。
  • Mistral Small 3.1 24B: 官方称量化可装 RTX 4090/32 GB Mac,而 BF16 约需 55 GB;精度是内存声明的一部分。

这些事实只形成候选,不形成质量排名。

Fit 流程

定义任务、并发、上下文、输出和延迟;选精确产物并算原始权重;确认模板/运行时;从短原生上下文和并发 1 开始;测峰值 VRAM/RAM、offload、首 token、decode 和接受结果;独立增加上下文;保留 10–20% 运维余量。

Fit 不等于有用

工具调用可靠的小模型可能胜过慢速 offload 大模型;降低速度和注意质量的长上下文可能不如短窗口检索。用本地评测协议决定。

档位偏向消费级 NVIDIA。Apple unified memory、AMD、集成 GPU、NPU、电力限制和服务器卡表现不同。模型卡可能使用有利运行时/上下文。服务绑定 loopback,审查许可证和遥测;本地执行不自动等于隐私与安全。