Transformer:从原始架构到现代组件
厘清 2017 年原始 Encoder-Decoder 与现代 Decoder-only 架构在 Norm、位置编码、注意力变体及 FFN 上的差异,并分析训练与推理成本。
厘清 2017 年原始 Encoder-Decoder 与现代 Decoder-only 架构在 Norm、位置编码、注意力变体及 FFN 上的差异,并分析训练与推理成本。
解析 CNN 的归纳偏置、通道、填充、步幅、池化机制,厘清平移等变与平移不变的核心差异。
通过张量形状、反向传播推导及 XOR 实例,解析 MLP 的表达能力、优化陷阱与归纳偏置。
从状态压缩、时间反向传播和 LSTM 门控理解 RNN 的优势、梯度失败与流式边界。
从 Q/K/V、mask 和数值例子理解内容寻址、多头注意力、复杂度与解释边界。
一条把 MLP、RNN、注意力与 Transformer 串起来,同时把数据泄漏和分布偏移纳入评估的学习路径。
区分 ReLU、GELU、SiLU/Swish 与 GLU 变体,并用等预算实验选择现代神经网络的非线性。
潜变量与扩散模型在数据分布学习上的核心路径概览。