跳到主要内容

1 篇文档带有标签「sparse-attention」

查看所有标签

Attention 演进与 KV Cache 压缩

从 Multi-Head Attention (MHA)、Grouped-Query Attention (GQA) 到 DeepSeek MLA (Multi-Head Latent Attention) 与 SnapKV/PyramidKV 稀疏压缩机制。