跳到主要内容

数据集:溯源、泄漏与评估

能下载的表格不等于证据。数据集只是特定收集规则、测量流程、版本和范围下的记录快照。“缺失”和“被收录”本身往往隐含了特定的机制或偏差。

阅读顺序

  1. 用本页评估数据是否适配当前问题。
  2. 在进行任何模型训练前,先解决 数据切分与泄漏 问题。
  3. 利用 分布偏移下的评估,将测试结果锚定到具体的部署分布和成本约束上。

适用性审查

维度核心问题常见陷阱
溯源 (Provenance)谁生成的?为什么?怎么做的?镜像数据丢失原始定义和版本信息
单元 (Unit)一行代表人、事件、时间窗口还是聚合值?将重复出现的实体误判为独立样本
总体 (Population)结论应覆盖哪些群体?将便利样本(Convenience Sample)误称为代表性样本
测量 (Measurement)变量和标签如何观测、编码及修订?将行政代理指标直接当作真实构念(Construct)
时间 (Time)特征何时可用?标签何时成熟?使用未来字段或事后修订值导致泄漏
缺失 (Missingness)谁缺失了?为什么缺失?插补掩盖了系统性的“不可见”群体
连接 (Joins)Key 是否唯一?粒度是否一致?多对多连接导致行数膨胀
权利 (Rights)许可、同意及隐私条款是否允许该用途?误将“公开可见”等同于“可任意使用”
可复现性 (Reproducibility)版本、查询、校验和及变换步骤能否重建?URL 指向动态变化的 latest 文件而非固定版本

尽早拒绝不适用的数据集,本身就是一个成功的工程决策。

最小化数据表 (Minimal Datasheet)

name: dataset-name
version_or_vintage: immutable identifier
producer: responsible institution
purpose: original collection purpose
unit: one row means ...
population_and_scope: geography, time, inclusion
measurement: feature and label construction
known_exclusions: missing or censored groups
license_and_sensitivity: terms, consent, privacy
retrieval: url/query/date/checksum
transformations: ordered executable steps
split_keys: entity, group, time
intended_use: supported decisions
out_of_scope: prohibited or unsupported uses

《Datasheets for Datasets》提供了更完整的框架。上述最小记录旨在支持实验的可追溯性,并不构成对伦理合规或统计有效性的认证。

权威数据源入口

领域来源适用场景仍需核查项
美国公共数据Data.gov跨机构数据发现实际生产机构及具体条款
美国人口/经济Census调查、人口及商业数据抽样方法、权重、地理范围及版本
全球发展World Bank国家指标定义变更及缺失情况
宏观/金融FRED带来源的时间序列数据版本(Vintage)、修订及发布时间
全球健康WHO Data健康指标报告制度及国家覆盖差异

官方机构在定义和修订方面更权威,但这不代表数据无偏。社区目录适合用于发现数据;当结论依赖于定义、许可或数据版本时,务必回溯至原始生产机构。

概念辨析

  • 数据质量:数值是否准确、完整、一致?
  • 数据泄漏:开发过程是否跨越了部署时的信息边界?
  • 分布偏移:实际使用场景的分布是否与训练/测试分布不同?

干净的数据也可能存在泄漏;无泄漏的数据在政策变更后也可能失效。插补无法修复切分设计缺陷,正确的切分设计也不能保证外部有效性。

停止条件

在以下任一要素未明确时,不要急于训练复杂模型:预测时点、目标定义、实体边界、标签成熟期、权利/敏感性、切分键、基线(Baseline)或错误代价。

应将未知项记录为阻塞项(Blockers),而不是用默认的随机切分来掩盖问题。

探索关联打开关联网络