线性与二次判别分析
线性判别分析(LDA)和二次判别分析(QDA)都用高斯分布描述各个类别,再把类条件密度与类别先验 结合起来。
对于类别 ,
忽略所有类别共有的项,判别得分为
得分最高的类别就是预测结果。
从训练数据到决策
各类别均值由该类训练样本估计。若没有依据充分的目标总体先验,可用 估计类别先验。一种明确的最大似然约定是:把类内离均差外积之和除以 ,得到 ;LDA 则汇总所有类别的类内离均差外积,再除以 。无偏协方差估计改用 或 作分母。应说明采用哪种约定,因为库实现不一定与这里的计算相同。
考虑一维例子:类别 0 的训练值为 ,类别 1 为 。均值分别为 0 和 2,共享的最大似然方差为 1,先验均为 ,所以
边界是 ;在 处,类别 1 的后验概率为 。保持均值和方差不变,若先验改为 、,边界会移到 。先验会实际改变决策,并非拟合后的附加标签。
在拟合模型下,选择后验最大的类别使预期零一损失最小。错误成本不相等时,应改为最小化后验预期成本。高斯拟合与这条决策规则都不能保证模型符合部署分布。
LDA 与 QDA
共享协方差时,各类别得分中关于 的二次项会相互抵消,从而得到线性边界。分类别协方差会保留这些项,因此产生二次边界。若每类协方差都是对角矩阵,就相当于采用了高斯朴素贝叶斯式的条件独立假设。
难点在协方差
- 在高维或小样本场景中,经验协方差矩阵可能噪声很大,甚至是奇异矩阵。
- 收缩估计以一定偏差换取更稳定的协方差;其强度需要有意识地选择或估计。
- 在精确运算下,未正则化的全协方差 LDA/QDA 对共同的可逆仿射特征变换保持预测不变。缩放仍会影响数值条件和某些正则化方案;类别不平衡会影响估计出的先验。
- 参数有闭式估计,并不意味着模型选择无需验证。
上面的密度公式要求协方差正定。若有 个特征,单类经验协方差的秩至多为 ;因此 QDA 每类至少要有 个观测才可能满秩,达到这个数量也不保证估计稳定。LDA 的合并协方差秩至多为 。矩阵奇异时,应去除冗余维度,或使用经过验证的协方差正则化。
监督式投影
LDA 也可以把数据投影到若干方向,使类别均值之间的差异相对于类内变化尽可能大。这种监督式降维视角与把 LDA 用作分类器有关,但并不相同。对于 个类别,最多只有 个判别方向能够携带类间分离信息。
高斯假设可以是有用的近似,但预测概率仍需在目标分布上检查校准情况。应将 LDA 和 QDA 与逻辑回归及简单基线比较,而不是只根据边界形状做选择。
当前的协方差估计器和实现细节见 scikit-learn LDA/QDA 指南。