自注意力机制(Self-Attention)是Transformer架构的核心组件,它让输入序列中的每一个位置都与序列中所有其他位置「互动」,按相关性分配注意力权重,从而融合全局信息。该机制由Google在2017年的Transformer论文中正式提出,自此改变了深度学习的格局。
工作原理 1. 每个词被转换成三组向量:查询(Query)、键(Key)、值(Value) 2. 用查询与所有位置的键计算相似度,得到注意力分数 3. 按分数加权求和所有位置的值,得到融合了全文信息的输出 4. 直觉理解:模型读到某个词时,会「环顾全文」,判断哪些词与它关系最密切,给它们更多关注
核心优势
- 并行计算:所有位置可同时处理,不像RNN那样必须按顺序逐个读取
- 长距离依赖:无论两个词相隔多远,都能直接建立联系,这是循环模型难以做到的
- 多头注意力:多个注意力头并行工作,各自关注语法、指代、语义等不同角度的关系,理解更丰富
- 自注意力是大语言模型理解上下文、实现「上下文感知」的基础,几乎所有现代大模型都依赖它
- 局限是计算量随序列长度平方增长,处理超长文本成本高,因此催生了稀疏注意力、线性注意力等优化方案。