机器学习核心概念速查
模型、参数与超参数
模型 利用参数 将输入 映射为预测值。假设类(Hypothesis Class) 指由选定表示形式所能表达的所有函数集合。超参数(如正则化强度、树深度、网络宽度)用于控制学习过程或限定假设类,它们不参与内部优化拟合,而是由外部设定。
损失与经验风险
单样本损失衡量预测值与真实标签之间的偏差:
训练目标通常是最小化经验风险与正则项之和:
这里 是训练样本数, 是第 个样本的输入和目标。平均损失称为经验风险,表示模型在这些已观察样本上的误差。正则项 用来惩罚参数的某些性质,例如系数过大; 控制这项惩罚相对于平均损失的权重。 常称为代价函数或目标函数。比较两个目标时,应核对所用数据、平均方式和惩罚项,不能只看名称。
不同任务对应不同的损失函数,隐含不同的假设:
训练损失与报告指标
损失用于拟合,指标用于判断模型在指定数据划分和用途下的表现。两者可以使用同一函数,但不必相同。对于标签 ,比较以下正类概率预测:
这里使用自然对数,对数损失为 。准确率掩盖了 B 在中间两个样本上较弱的概率预测。反过来,在审核容量固定时,对数损失更低也不保证业务成本更低。scikit-learn 指标指南区分了这些评估目标。
没有有用特征时,训练均值常数使平方误差最小,训练中位数使绝对误差最小,多数类规则则是准确率基线。先在训练数据上估计这些常数,再在相同的留出样本上比较所有模型。
似然
对于概率模型 ,最大似然估计(MLE)旨在找到使观测数据出现概率最大的参数:
因此,最小化负对数似然等价于最大化似然。损失函数的选择应基于观测模型的特性,而非仅仅因为某个库提供了该选项。
这个求和形式假定:给定输入和参数后,各观测条件独立。存在依赖的序列应使用联合或序列似然。独立、同一固定方差的高斯误差对应平方误差损失(相差一个正系数和常数);伯努利观测对应二元交叉熵。
预测时推理是用已拟合模型处理新输入,不更新参数;统计推断是对未知量给出带不确定性的结论。这两者都不同于优化:优化负责通过数值计算寻找参数。
优化
梯度下降沿目标函数梯度的反方向更新参数。学习率 控制步长;步长过大会使目标值增大,甚至导致发散:
- 批量梯度下降(Batch GD):每次更新使用全量训练集。
- 随机梯度下降(SGD):每次更新仅使用单个样本。
- 小批量方法(Minibatch):使用小批量样本估计梯度,是计算效率与稳定性的常见折中。
牛顿法利用局部曲率信息:
在良态最优点附近,牛顿法可快速收敛,但构造或求解 Hessian 矩阵计算量大且可能不稳定。此外,优化器找到较低的训练目标值,并不等同于模型具备良好的泛化能力。
泛化边界
训练误差、验证误差和测试误差回答的是不同层面的问题。超参数调优会消耗验证集的信息,因此测试集必须严格隔离,不得参与该循环。评估时还需考虑分布漂移、数据泄漏、子群体表现、不确定性以及不同错误类型的代价。
继续阅读 线性模型地图。主要外部课程参考 Berkeley CS 189。