跳到主要内容

线性代数

线性代数核心在于研究向量空间以及保持加法与数乘运算不变的线性变换。建议遵循以下学习路径:

  1. 向量、张成空间、线性无关、基与维数;
  2. 线性映射及其矩阵表示;
  3. 线性方程组、高斯消元、秩与零空间;
  4. 内积、正交性、投影与最小二乘法;
  5. 行列式、特征值与特征向量;
  6. 奇异值分解(SVD)与低秩近似;
  7. 在优化、数据分析及机器学习中的实际应用。

下面的速查限定于有限维实向量、线性方程组和最小二乘,预备知识是初等代数。MIT OpenCourseWare 18.06SC 提供相关证明,并按上述路线继续讲解矩阵分解。

向量、基与矩阵形状

Rn\mathbb R^n 中的向量相对于选定的基有 nn 个实坐标。一组向量的张成空间包含它们的所有线性组合;若只有系数全为零的组合才得到零向量,这组向量就线性无关。既线性无关又能张成整个空间的向量组称为,基中向量的个数就是维数。例如 (1,0)(1,0)(0,1)(0,1)R2\mathbb R^2 的一组基,而 (1,2)(1,2)(2,4)(2,4) 只能张成一条直线。

线性映射满足 T(au+bv)=aT(u)+bT(v)T(au+bv)=aT(u)+bT(v)。采用列向量时,矩阵 ARm×nA\in\mathbb R^{m\times n} 把输入 xRnx\in\mathbb R^n 映射为 AxRmAx\in\mathbb R^m。每一列都是一个输入基向量的像,因此 AxAx 是各列的加权和。若 BRn×kB\in\mathbb R^{n\times k},则 ABRm×kAB\in\mathbb R^{m\times k} 表示先作用 BB 再作用 AABABA 甚至可能没有定义。加上非零偏置后的 Ax+bAx+b 是仿射映射,不是线性映射。

方程组何时有解?

AA列空间是各列向量张成的空间,也就是所有能写成 AxAx 的向量。这个空间的维数称为矩阵的零空间记作 kerA\ker A,由满足 Az=0Az=0 的向量 zz 组成;dim\dim 表示维数。若矩阵有 nn 列,秩与零空间维数满足 dimkerA=nrank(A)\dim\ker A=n-\operatorname{rank}(A)。下面的 [Ab][A\mid b] 表示把 bb 添到 AA 的右侧,作为新的一列。

  • Ax=bAx=b 有解当且仅当 bb 属于列空间,等价地,rank(A)=rank([Ab])\operatorname{rank}(A)=\operatorname{rank}([A\mid b])
  • x0x_0 是一个解,则所有解都可写成 x0+zx_0+z,其中 zkerAz\in\ker A
  • 有解的方程组只有在各列线性无关时才有唯一解。方阵可逆当且仅当秩为 nn;对方阵而言,这也等价于行列式非零。

例如 x1+2x2=3x_1+2x_2=32x1+4x2=62x_1+4x_2=6 描述同一条直线。矩阵的秩为 1,所有解为 (32t,t)(3-2t,t)。若将第二个等式右端改为 7,方程组便无解。仅数方程个数,无法判断解是否存在或唯一。

正交与最小二乘

点积定义为 uTv=iuiviu^Tv=\sum_i u_iv_i;点积为零时两向量正交。欧氏范数为 u2=uTu\|u\|_2=\sqrt{u^Tu}。无法精确拟合时,最小二乘法最小化 Axb22\|Ax-b\|_2^2。在最小值处,残差 r=bAxr=b-Ax 与每一列正交,因此得到正规方程 ATAx=ATbA^TAx=A^Tb

用同一个常数 cc 拟合观测值 1 和 3:此时 A=(1,1)TA=(1,1)^Tb=(1,3)Tb=(1,3)^T。正规方程为 2c=42c=4,所以 c=2c=2;残差 (1,1)T(-1,1)^T(1,1)T(1,1)^T 正交。拟合向量是 bb 在列空间上的正交投影。投影唯一,但系数只有在 AA 列满秩时才唯一。此时 ATAA^TA 可逆,不过数值计算通常应使用 QR 或 SVD 求解,而不是显式求逆。

矩阵分解回答什么问题?

对方阵,Av=λvAv=\lambda vv0v\ne0 表示映射将该向量缩放(也可能变为零)。实矩阵未必有实特征值,也未必有足够的特征向量组成基。相比之下,每个实 m×nm\times n 矩阵都有奇异值分解 A=UΣVTA=U\Sigma V^T,其中 U,VU,V 正交,矩形矩阵 Σ\Sigma 中的奇异值非负。非零奇异值的个数等于秩。保留最大的若干奇异值,可得到 Frobenius 范数意义下的最优低秩近似;相对于最大奇异值很小的奇异值则提示求解可能放大扰动。这也是线性代数与数值分析的连接点。

探索关联打开关联网络