跳到主要内容

AI 笔记中的证据与偏差

一篇 AI 笔记不会因为有链接和比较表就自动中立。它应告诉读者:正在提出什么类型的主张、证据能支持到哪里、哪些仍是判断。

主张与证据阶梯

主张类型最低证据仍不能证明什么
协议/API 事实带版本规范或当前官方文档实现完整、安全或实践中互通
模型/产品能力模型卡/文档加任务级测试在未测场景中普遍更强或可靠
Benchmark 结果任务版本、模型、harness、日期、配置和结果记录可迁移到另一仓库、语言、硬件或风险等级
个人观察可复现 run card 与保留的失败样例群体层面的性能
建议明确标准、替代方案、成本和失败阈值普遍最佳选择
预测假设、情景和不确定性已核验的未来事实

官方来源对接口和厂商声明有权威性;对“质量更好”则是利益相关证据。独立 benchmark 降低厂商偏差,却仍有任务、配置和发表偏差。

偏差登记表

重要 AI 笔记至少检查:

  • 选择偏差: 哪些模型、工具、论文、语言和失败被省略;
  • 厂商偏差: 是否把产品定位重复成经验结论;
  • Benchmark 偏差: 污染、任务狭窄、指标选择、模型/harness 混杂和不确定性缺失;
  • 时间偏差: 把快照写成永久排名;
  • 硬件偏差: 默认 NVIDIA、Apple、显存、电力或联网条件;
  • 语言/领域偏差: 把英语/Python 结果外推到别的语言或高风险领域;
  • 自动化偏差: 把流畅输出或“完成”消息当作正确性证据;
  • 个人工作流偏差: 把终端编码偏好外推到 IDE、团队和生产。

登记偏差不会消除偏差,但会让剩余视角可见、可测。

示例:紧凑主张记录

claim: gpt-oss-20b 可在 16 GB 机器上成为实用本地 agent 模型
kind: recommendation
as_of: 2026-08-10
facts:
- 厂商称 MXFP4 模型可在 16 GB 内运行
assumptions:
- 运行时支持 Harmony 和精确量化
- 上下文与 KV cache 能放进剩余预算
missing_evidence:
- 我的编码任务接受率
- 我的硬件延迟与峰值内存
alternatives:
- 更小 dense 模型
- 24 GB 上更大模型
- 托管模型升级处理
falsifier: 工具调用或补丁失败率持续高于预设阈值

事实、部署推论和个人建议保持分离。

审阅流程

  1. 润色前先提取主张。
  2. 标记为事实、报告结果、观察、推论、偏好或预测。
  3. 让证据强度匹配后果;采购和安全结论不能只看产品页。
  4. 主动找可信反例或竞争性解释。
  5. 拆开耐久概念与日期化产品事实。
  6. 保留失败案例,而非只保留成功 demo。
  7. 写出什么会改变结论,并按变化速度设置 review_after

用它审阅 AI Systems前沿雷达。目标是更好地分歧和核验,而不是假装拥有“无视角的客观性”。