跳到主要内容

怎样读模型卡、许可证与基准成绩

模型选型首先是在判断:某个具体版本,能否在给定约束下完成自己的任务。模型名称、参数量和总榜排名只是索引,真正需要读的是输入输出、训练与评估条件,以及可复现的交付物。

Model Cards 提出随模型说明适用用途和不同条件下的表现。模型卡提供调查入口;一张写得完整的卡片本身并不是质量认证。

先确定拿到的是什么

同一个系列可能同时发布基础权重、指令版本、蒸馏版本和多个量化文件。名称相似不意味着输入模板、输出行为或硬件需求相同。Hugging Face 的模型卡文档说明模型说明与结构化元数据如何共存。读取时,把以下问题落实到确切版本:

问题要找的内容缺失时会影响什么
输入怎样组织?tokenizer、聊天模板、模态、长度限制模板错误或截断可能伪装成能力不足
输出是什么?文本、向量、相关性或类别分数不能把相似度当成动作正确率
训练改变了什么?基础模型、微调方式、数据范围无法判断新任务与训练任务的距离
文件怎样运行?权重格式、精度、支持的运行时下载成功不等于可在目标设备上运行
比较怎样产生?数据版本、提示词、指标、重试与预算分数可能来自不同问题或不同计算量

参数总量与单次激活参数量要分开,尤其是 MoE。宣传的最大上下文也要与实际配置和缓存成本一起读。

许可证、代码与权重分别查看

一个仓库可以同时包含代码、权重和数据引用。平台显示的许可证字段便于发现文件,但应打开相应的许可证和模型发布说明,确认它描述的是哪项交付物。仓库许可证说明展示了这些元数据如何标记。不要从封装代码的许可证推断模型权重、上游数据或服务条款也完全相同。

把版本号或修订标识与所用文件一起记录。模型在同名位置更新后,只留一个下载链接不能恢复原来的比较。托管 API 还应记录调用日期和可获得的模型版本信息。

一张榜单回答不了所有问题

HELM 将语言模型放在多种场景和指标下评估。这提醒我们先读评估对象,而不是先找最高分。准确率、校准、延迟、吞吐与成本是不同问题,只有在业务目标已经明确后才适合组合。

假设两个候选在同一组 100 个例子上测试:

情况例子数
两者都正确86
只有 A 正确4
只有 B 正确6
两者都错误4

A 的准确率为 90%,B 为 92%。但如果 B 独有的六次成功都是轻微格式问题,而它独有的四次失败都会丢失关键事实,单看两分差距不足以选 B。反过来,如果这些错误代价接近,还要看差异能否在新的同类样本上复现。这里的表是一个假设算例,不是产品测评。

还要区分“模型一次回答”与“系统得到最终答案”:是否搜索资料、调用工具、生成多个候选、重试、使用额外思考预算?同一个模型加更多计算,可能改变质量和延迟;不能把两套系统的差异全部归因于模型权重。

用一小批真实任务缩小候选

先从现有工作中选出不同难度与失败代价的任务,排除敏感材料或取得适当授权。固定输入和成功条件,保留一个便宜的基线。分类任务可用简单规则或小分类器;检索任务可用关键词搜索;代码任务应以测试与人工检查为依据。

选择阈值、修改提示词、调整检索策略所用的样本属于开发过程,不能再次当成独立验证。将新的测试样本留到决定设置之后;具体方法见数据划分与泄漏

最后保留一个可解释的选择记录:为什么选这个版本,哪类错误仍会出现,什么输入超出已验证范围,什么变化会触发重测。当前产品候选见模型与 API 选型,本机实验采用本地模型评测

探索关联打开关联网络