跳到主要内容

数据科学

数据科学不是软件清单,而是一条把问题、观测和行动连接起来的证据链。模型可以优化一个数,却不能自行决定样本代表谁、标签如何产生、错误代价是什么。

工作路径

  1. 定义问题与行动:结果要支持哪个决策、估计或解释?
  2. 画出数据生成过程:谁被观察、何时测量、哪些人缺失、标签如何形成?
  3. 审查数据集:记录来源、单位、许可、敏感性、版本和变换;从数据集地图开始。
  4. 在建模前确定划分:预测时点、实体和部署场景决定随机、group、time 或 external split;见数据划分与泄漏
  5. 建立简单基线:常数、规则、线性模型或既有流程提供增量价值参照。
  6. 训练与选择:所有学习型预处理只在训练折拟合;validation 用于选择,test 留到协议结束。
  7. 评估用途而非排行榜:同时看阈值、成本、校准、群体/时间切片和不确定性;见分布偏移下的评估
  8. 沟通有限结论:报告失败、排除项、数据边界和不能外推的条件。
  9. 部署后监测:输入、标签延迟、反馈回路和人为流程会改变分布。

探索与确认

同一数据可用于发现假设,也可用于检验预先确定的假设,但不能不加惩罚地反复承担两种角色。看过 test 后改特征、阈值或样本排除规则,就已经把 test 信息用于开发。应另取未见数据、使用 nested evaluation,或明确把结果降级为探索性。

两条学习线

路径页面读完应得到
概念语言工作术语精确说明 observation、feature、target、population、metric 与 provenance
数据证据Dataset检查来源、泄漏、切分、shift、指标和报告
模型基础Machine Learning理解损失、基线、泛化与模型族
架构基础Deep Learning理解表示与计算,但不把架构替代评估

最小分析包

question.md 问题、预测时点、行动和损失
provenance.yaml 来源、版本、许可、单位和变换
split.py 可执行且有测试的划分规则
pipeline.* 只在训练数据拟合的预处理与模型
results/ 每次运行、seed、指标、切片和失败
report.md 结论、区间、限制和部署监测

覆盖偏差

这条路径偏重表格/监督任务、可计算指标和可复现实验。质性研究、因果识别、参与式设计、隐私、治理与权力关系不能简化为多加一个 metric。公开数据、权威机构或大样本也不自动代表测量有效、许可充分或使用公平。

Berkeley Data 100提供计算与统计相结合的外部课程;DatasheetsModel Cards 帮助记录数据和模型的限制,不能取代领域审查。

探索关联打开关联网络