本地模型评测
实验单位不是模型名,而是:
权重 + 量化 + 运行时 + 模板 + 上下文策略 + 生成设置 + 工具 + harness + 硬件
改一项就可能不再可比。
固定 Run Card
model: organization/model
revision: immutable commit 或 artifact hash
artifact: 精确文件与量化
runtime: 名称、版本、backend、driver
template: chat/reasoning/tool parser
context: 原生上限、请求长度、KV 类型
generation: temperature、top-p、最大输出、seed
hardware: GPU、VRAM、RAM、CPU offload
harness: 版本、工具、权限、循环预算
Run card 与原始结果、失败样例一起保存。
三层评测
- 集成冒烟: 普通对话、精确 JSON、有效工具、畸形/拒绝调用、相关多语言、取消和上下文边界。
- 个人任务重放: 10–30 个有外部验收的任务。编码覆盖缺陷、跨文件 API、测试诊断、陌生文档、证据不足和越界动作;知识工作覆盖引用提取、冲突来源、时间问题和弃答。
- 系统行为: 接受率、严重度加权失败、首 token、decode、总耗时、峰值内存、offload、重试、工具有效率、无关 diff 与人工介入。
比较例子
同一 7B 模型 Q4/Q6,20 个任务各跑 3 次:
| 指标 | Q4 | Q6 |
|---|---|---|
| 接受运行 | 42/60 | 48/60 |
| 有效工具调用 | 54/60 | 58/60 |
| 中位总耗时 | 38 s | 46 s |
| 峰值 VRAM | 实测值 | 实测值 |
| 严重失败 | 4 | 1 |
这些是报告占位例,不是声称的测试结果。写操作可能值得用 Q6,Q4 仍可做只读分拣。小样本报告计数与不确定性,并保留逐任务结果。
量化、上下文与外部榜单
比较量化时固定运行时、提示和生成;必须含精确编辑与工具测试 。先测原生上下文,再用干扰文档和不同证据位置扩长,并同时测 KV 与质量。
lm-evaluation-harness、HELM 和 Aider 榜单是外部锚点,不复现私有仓库、量化、权限和人工成本。检查任务版本、污染、提示适配、样本数和结果是否复现。
偏差与决策
个人套件会过拟合当前工作,公开套件过拟合公开分布;英语/Python、成功完成、可用硬件和能跑起来的模型通常被过度代表。保留已知难失败并定期加入新 holdout。
选择能以显存余量和可接受严重失败率越过预先声明阈值的最小配置。任一 run-card 字段变化后重测,而不是榜单一更新就重测。