AI 笔记中的证据与偏差
一篇 AI 笔记不会因为有链接和比较表就自动中立。它应告诉读者:正在提出什么类型的主张、证据能支持到哪里、哪些仍是判断。
主张与证据阶梯
| 主张类型 | 最低证据 | 仍不能证明什么 |
|---|---|---|
| 协议/API 事实 | 带版本规范或当前官方文档 | 实现完整、安全或实践中互通 |
| 模型/产品能力 | 模型卡/文档加任务级测试 | 在未测场景中普遍更强或可靠 |
| Benchmark 结果 | 任务版本、模型、harness、日期、配置和结果记录 | 可迁移到另一仓库、语言、硬件或风险等级 |
| 个人观察 | 可复现 run card 与保留的失败样例 | 群体层面的性能 |
| 建议 | 明确标准、替代方案、成本和失败阈值 | 普遍最佳选择 |
| 预测 | 假设、情景和不确定性 | 已核验的未来事实 |
官方来源对接口和厂商声明有权威性;对“质量更好”则是利益相关证据。独立 benchmark 降低厂商偏差,却仍有任务、配置和发表偏差。
偏差登记表
重要 AI 笔记至少检查:
- 选择偏差: 哪些模型、工具、论文、 语言和失败被省略;
- 厂商偏差: 是否把产品定位重复成经验结论;
- Benchmark 偏差: 污染、任务狭窄、指标选择、模型/harness 混杂和不确定性缺失;
- 时间偏差: 把快照写成永久排名;
- 硬件偏差: 默认 NVIDIA、Apple、显存、电力或联网条件;
- 语言/领域偏差: 把英语/Python 结果外推到别的语言或高风险领域;
- 自动化偏差: 把流畅输出或“完成”消息当作正确性证据;
- 个人工作流偏差: 把终端编码偏好外推到 IDE、团队和生产。
登记偏差不会消除偏差,但会让剩余视角可见、可测。
示例:紧凑主张记录
claim: gpt-oss-20b 可在 16 GB 机器上成为实用本地 agent 模型
kind: recommendation
as_of: 2026-08-10
facts:
- 厂商称 MXFP4 模型可在 16 GB 内运行
assumptions:
- 运行时支持 Harmony 和精确量化
- 上下文与 KV cache 能放进剩余预算
missing_evidence:
- 我的编码任务接受率
- 我的硬件延迟与峰值内存
alternatives:
- 更小 dense 模型
- 24 GB 上更大模型
- 托管模型升级处理
falsifier: 工具调用或补丁失败率持续高于预设阈值
事实、部署推论和个人建议保持分离。
审阅流程
- 润色前先提取主张。
- 标记为事实、报告结果、观察、推论、偏好或预测。
- 让证据强度匹配后果;采购和安全结论不能只看产品页。
- 主动找可信反例或竞争性解释。
- 拆开耐久概念与日期化产品事实。
- 保留失败案例,而非只保留成功 demo。
- 写出什么会改变结论,并按变化速度设置
review_after。
用它审阅 AI Systems 和前沿雷达。目标是更好地分歧和核验,而不是假装拥有“无视角的客观性”。