数据科学
数据科学不是软件清单,而是一条把问题、观测和行动连接起来的证据链。模型可以优化一个数,却不能自行决定样本代表谁、标签如何产生、错误代价是什么。
工作路径
- 定义问题与行动:结果要支持哪个决策、估计或解释?
- 画出数据生成过程:谁被观察、何时测量、哪些人缺失、标签如何形成?
- 审查数据集:记录来源、单位、许可、敏感性、版本和变换;从数据集地图开始。
- 在建模前确定划分:预测时点、实体和部署场景决定随机、group、time 或 external split;见数据划分与泄漏。
- 建立简单基线:常数、规则、线性模型或既有流程提供增量价值参照。
- 训练与选择:所有学习型预处理只在训练折拟合;validation 用于选择,test 留到协议结束。
- 评估用途而非排行榜:同时看阈值、成本、校准、群体/时间切片和不确定性;见分布偏移下的评估。
- 沟通有限结论:报告失败、排除项、数据边界和不能外推的条件。
- 部署后监测:输入、标签延迟、反馈回路和人为流程会改变分布。
探索与确认
同一数据可用于发现假设,也可用于检验预先确定的假设,但不能不加惩罚地反复承担两种角色。看过 test 后改特征、阈值或样本排除规则,就已经把 test 信息用于开发。应另取未见数据、使用 nested evaluation,或明确把结果降级为探索性。
两条学习线
最小分析包
question.md 问题、预测时点、行动和损失
provenance.yaml 来源、版本、许可、单位和变换
split.py 可执行且有测试的划分规则
pipeline.* 只在训练数据拟合的预处理与模型
results/ 每次运行、seed、指标、切片和失败
report.md 结论、区间、限制和部署监测
覆盖偏差
这条路径偏重表格/监督任务、可计算指标和可复现实验。质性研究、因果识别、参与式设计、隐私、治理与权力关系不能简化为多加一个 metric。公开数据、权威机构或大样本也不自动代表测量有效、许可充分或使用公平。
Berkeley Data 100提供计算与统计相结合的外部课程;Datasheets 与 Model Cards 帮助记录数据和模型的限制,不能取代领域审查。