深度学习:从函数逼近到序列模型
深度学习用可训练的层表示函数。这组笔记把模型计算、目标函数、梯度和使用方式接起来,不把不同架构当成逐代替换的阶梯。更完整的教材背景见 《动手学深度学习》与 《Deep Learning》。
共同基础
线性回归连接参数、残差与梯度更新。Softmax 回归解释 logit、归一化分数和分类损失。多层感知机加入非线性隐藏表示,激活函数与门控 FFN解释层内的具体运算。把这些运算接起来的链式法则,见自动微分。
表示结构的不同方式
CNN 与 RNN 是并列分支,不必先学完它们才能理解注意力。MLP 仍存在于 Transformer 的前馈层中,注意力也能与循环或卷积结合。ReLU 并没有被 GELU、SiLU 或门控普遍淘汰,选择取决于模型和目标。
从模型到训练与生成
KV Cache承接 Transformer 的自回归推理:未变化的因果前缀何时可以复用,内存又怎样增长。生成模型地图区分潜变量模型与扩散模型的训练目标。
训练损失反映拟合的目标,不等于模型在实际使用中有效。数据划分与泄漏解释预测时真正可用的信息,分布变化下的评估把结果与使用中的人群、时段及错误成本联系起来。证据与偏差区分论文主张、复现结果和推断。随机划分可能泄漏用户或未来信息,反复用测试集调参也会削弱分数的解释意义。
这张地图主要覆盖监督梯度训练与序列模型,不是强化学习、因果推断或所有架构家族的完整目录。