Transformer:从原始架构到现代组件
厘清 2017 年原始 Encoder-Decoder 与现代 Decoder-only 架构在 Norm、位置编码、注意力变体及 FFN 上的差异,并分析训练与推理成本。
厘清 2017 年原始 Encoder-Decoder 与现代 Decoder-only 架构在 Norm、位置编码、注意力变体及 FFN 上的差异,并分析训练与推理成本。
解析 MHA、GQA、MLA 架构差异及 SnapKV 等压缩策略,探讨内存、质量与实现复杂度的权衡。
从 Q/K/V、mask 和数值例子理解内容寻址、多头注意力、复杂度与解释边界。