稀疏注意力(Sparse Attention)是一种注意力机制的优化方案:让序列中的每个位置只对一部分经过挑选的位置计算注意力,而不是对全部位置「一视同仁」。它把计算成本从随长度平方增长降到近似线性,是大模型处理超长上下文的重要技术路线。
为什么要稀疏
- 标准自注意力的计算量随序列长度平方增长,上下文一长,计算和显存开销迅速失控
- 研究与实践都表明,模型真正高度依赖的往往是邻近位置和少数关键位置,对大部分远端位置的注意力权重很低,存在大量冗余计算
- 滑动窗口注意力:每个位置只关注前后固定范围内的邻居
- 全局加局部混合:少数「锚点」位置关注全局,其余位置只关注局部
- 分块与随机稀疏:按块划分或随机采样来分配注意力
- Mistral系列以滑动窗口注意力著称,用较低成本实现较长的有效上下文
- MiniMax M系列等国产模型也在架构中探索稀疏或混合注意力,以平衡长上下文能力与推理效率
- 稀疏模式可能牺牲部分全局建模能力,需与稠密注意力、推理加速等手段配合使用
- 2026年,稀疏注意力与线性注意力、混合专家注意力并行发展,共同推动百万级上下文窗口成为常态。