层归一化(Layer Normalization,LayerNorm)是对神经网络每一层的输出做标准化:把数值分布重新调整为均值 0、方差 1,再通过可学习的缩放和平移参数恢复表达能力。它解决的是深度网络的“数值失控”问题——层数一多,信号逐层放大或缩小,训练就会震荡甚至崩溃。
为什么大模型离不开它
Transformer 由几十上百层堆叠而成,每层都插入归一化,相当于每层都“校一次准”,让梯度能顺畅地从输出层流回输入层。没有它,GPT 规模的模型根本训不起来。
主要变体
- Post-LN:原始 Transformer 的用法(归一化放在残差之后),训练需要学习率预热
- Pre-LN:归一化放在子层之前,训练更稳,GPT 系列采用
- RMSNorm:只做缩放、不减均值,计算更省,Llama、Qwen、DeepSeek 等现代大模型的主流选择
一句话理解
残差连接是“高速公路”,层归一化是“限速与校准装置”,两者配合才让超深网络稳定训练成为可能。