跳到主要内容

数据科学核心术语表

本表聚焦于分析推理过程中的核心概念。具体工具名称请参见实现指南。

术语核心含义
问题 (Question)分析旨在支持的决策、对比、估算或解释。
观测 (Observation)数据集中记录的一个单元、事件或测量值。
特征 (Feature)作为模型输入的实测或衍生变量。
目标 / 标签 (Target / Label)监督模型需要预测的结果变量。
总体 (Population)结论旨在描述的全量案例集合。
样本 (Sample)用于推断总体特征的观测子集。
模式 (Schema)定义存储数据结构的名称、类型、约束及关系。
溯源 (Provenance)数据的来源、采集或转换过程,以及责任人。
基线 (Baseline)复杂分析应当超越的简单参照方法。
指标 (Metric)衡量误差、效用、拟合度或其他关注属性的具体规则。
训练集 (Training Set)用于估计模型参数的数据。
验证集 (Validation Set)开发阶段用于模型选择与调参的数据,独立于最终测试集。
测试集 (Test Set)留出数据,用于在既定评估设计下最终估算泛化能力。
数据泄漏 (Data Leakage)训练或特征构建过程中混入了模型实际部署时不可用的信息。
混杂变量 (Confounder)同时影响解释变量和结果,从而扭曲因果解释的变量。
校准 (Calibration)在特定评估设定下,预测概率与实际发生频率的一致性。
可复现性 (Reproducibility)基于记录的数据、代码、环境、参数及步骤,他人可重新运行并还原分析结果。

损失、目标函数和指标区分的是用途,不一定是公式。损失给单次预测评分;训练目标汇总损失,并可能加入惩罚项;评估指标描述指定总体和数据划分上的某种性质。例如,分类器可以最小化对数损失,却按固定审核容量下的召回率评估。参数在训练过程内拟合;超参数控制训练过程,并通过验证选择。示例见机器学习核心概念

需要明确限定的词汇

  • 平均 (Average):必须指明具体统计量——是均值、中位数、加权平均,还是其他定义。
  • 准确率 (Accuracy):需说明具体指标及类别分布;单看准确率可能掩盖关键错误。
  • 代表性 (Representative):需说明针对哪个总体,以及由何种抽样机制支撑该结论。
  • 显著 (Significant):需区分统计显著性与实际业务重要性。
  • 相关 (Correlation):切勿将统计关联直接等同于因果结论。

一句精确的描述胜过冗长的术语表。如果某个术语无法改变工作的执行方式或解释逻辑,它就不需要在此处给出规范定义。

探索关联打开关联网络