Transformer架构由Encoder和Decoder两大部分组成(虽然GPT等Decoder-Only模型只用Decoder)。
Encoder:将输入序列编码为上下文表示。每层包含Self-Attention→残差连接+层归一化→Feed-Forward→残差连接+层归一化。
Decoder:根据Encoder输出和已生成的部分生成下一个token。包含Masked Self-Attention(不能偷看未来)→Cross-Attention(关注Encoder输出)→Feed-Forward。
关键组件:
- 位置编码(Positional Encoding):因为并行处理丢失了顺序信息,需注入位置信息。Sinusoidal(固定正弦函数)、Learned(可学习)、RoPE(旋转位置编码,2024-2026主流)。
- 残差连接(Residual Connection):让梯度可以直接流过深层网络,解决了深层网络训练困难的问题。
- 层归一化(Layer Normalization):稳定训练,加速收敛。Pre-LN(归一化在Attention之前)vs Post-LN(之后),Pre-LN在现代模型中更常用。
- Feed-Forward Network:两层全连接+激活函数(ReLU/GELU/SwiGLU),提供非线性变换能力。
为什么Transformer是革命性的:完全并行计算、长距离依赖建模强大、通用性强(NLP/CV/Audio皆可用)、规模扩展性好。