跳到主要内容

机器学习核心概念速查

模型、参数与超参数

模型 fθf_{\theta} 利用参数 θ\theta 将输入 xx 映射为预测值。假设类(Hypothesis Class) 指由选定表示形式所能表达的所有函数集合。超参数(如正则化强度、树深度、网络宽度)用于控制学习过程或限定假设类,它们不参与内部优化拟合,而是由外部设定。

损失与经验风险

单样本损失衡量预测值与真实标签之间的偏差:

 ⁣(fθ(xi),yi).\ell\!\left(f_{\theta}(x_i),y_i\right).

训练目标通常是最小化经验风险与正则项之和:

J(θ)=1ni=1n ⁣(fθ(xi),yi)+λΩ(θ).J(\theta) = \frac{1}{n}\sum_{i=1}^{n} \ell\!\left(f_{\theta}(x_i),y_i\right) + \lambda\,\Omega(\theta).

这里 nn 是训练样本数,(xi,yi)(x_i,y_i) 是第 ii 个样本的输入和目标。平均损失称为经验风险,表示模型在这些已观察样本上的误差。正则项 Ω(θ)\Omega(\theta) 用来惩罚参数的某些性质,例如系数过大;λ\lambda 控制这项惩罚相对于平均损失的权重。JJ 常称为代价函数目标函数。比较两个目标时,应核对所用数据、平均方式和惩罚项,不能只看名称。

不同任务对应不同的损失函数,隐含不同的假设:

任务损失示例关键边界/特性
回归平方误差对大残差惩罚极重
二分类(概率)二元交叉熵 / 逻辑损失需基于概率模型或 Logit 解释
互斥多分类Softmax 交叉熵区别于多标签分类
间隔分类Hinge 损失优化间隔,本身不直接提供校准概率

训练损失与报告指标

损失用于拟合,指标用于判断模型在指定数据划分和用途下的表现。两者可以使用同一函数,但不必相同。对于标签 (0,0,1,1)(0,0,1,1),比较以下正类概率预测:

模型概率阈值为 0.5 时的准确率平均对数损失
A(0.1,0.4,0.6,0.9)(0.1,0.4,0.6,0.9)100%约 0.308
B(0.01,0.49,0.51,0.99)(0.01,0.49,0.51,0.99)100%约 0.342

这里使用自然对数,对数损失为 14i[yilogpi+(1yi)log(1pi)]-\frac14\sum_i[y_i\log p_i+(1-y_i)\log(1-p_i)]。准确率掩盖了 B 在中间两个样本上较弱的概率预测。反过来,在审核容量固定时,对数损失更低也不保证业务成本更低。scikit-learn 指标指南区分了这些评估目标。

没有有用特征时,训练均值常数使平方误差最小,训练中位数使绝对误差最小,多数类规则则是准确率基线。先在训练数据上估计这些常数,再在相同的留出样本上比较所有模型。

似然

对于概率模型 pθ(yx)p_{\theta}(y\mid x),最大似然估计(MLE)旨在找到使观测数据出现概率最大的参数:

θ^ML=argmaxθilogpθ(yixi).\hat{\theta}_{\mathrm{ML}} = \arg\max_{\theta} \sum_i \log p_{\theta}(y_i\mid x_i).

因此,最小化负对数似然等价于最大化似然。损失函数的选择应基于观测模型的特性,而非仅仅因为某个库提供了该选项。

这个求和形式假定:给定输入和参数后,各观测条件独立。存在依赖的序列应使用联合或序列似然。独立、同一固定方差的高斯误差对应平方误差损失(相差一个正系数和常数);伯努利观测对应二元交叉熵。

预测时推理是用已拟合模型处理新输入,不更新参数;统计推断是对未知量给出带不确定性的结论。这两者都不同于优化:优化负责通过数值计算寻找参数。

优化

梯度下降沿目标函数梯度的反方向更新参数。学习率 η>0\eta>0 控制步长;步长过大会使目标值增大,甚至导致发散:

θθηJ(θ).\theta \leftarrow \theta-\eta\nabla J(\theta).
  • 批量梯度下降(Batch GD):每次更新使用全量训练集。
  • 随机梯度下降(SGD):每次更新仅使用单个样本。
  • 小批量方法(Minibatch):使用小批量样本估计梯度,是计算效率与稳定性的常见折中。

牛顿法利用局部曲率信息:

θθ[2J(θ)]1J(θ).\theta \leftarrow \theta-\left[\nabla^2J(\theta)\right]^{-1}\nabla J(\theta).

在良态最优点附近,牛顿法可快速收敛,但构造或求解 Hessian 矩阵计算量大且可能不稳定。此外,优化器找到较低的训练目标值,并不等同于模型具备良好的泛化能力。

泛化边界

训练误差、验证误差和测试误差回答的是不同层面的问题。超参数调优会消耗验证集的信息,因此测试集必须严格隔离,不得参与该循环。评估时还需考虑分布漂移、数据泄漏、子群体表现、不确定性以及不同错误类型的代价。

继续阅读 线性模型地图。主要外部课程参考 Berkeley CS 189

探索关联打开关联网络