分布式训练(Distributed Training)指把模型训练任务拆分到多张 GPU/多台机器上并行进行。单卡显存和算力远不够训练千亿参数模型,分布式训练是“拼图”式的解决方案。
核心并行策略
- 数据并行(DP):每张卡放完整模型副本,各自吃不同批次数据,再同步梯度。最简单常用
- 张量并行(TP):把单层的权重矩阵切开,多卡合力算一层。通信频繁,一般限于机内 NVLink
- 流水线并行(PP):按层切分,不同卡负责不同层段,像流水线一样接力
- 专家并行(EP):MoE 模型把不同专家分布在不同卡上
- ZeRO / FSDP:把优化器状态、梯度、参数分片到各卡,大幅省显存
现实组合
训练一个千亿模型通常“多维混合并行”——机内张量并行 + 跨机流水线 + 全局数据并行,配合高速互联(InfiniBand / NVLink)。
延伸
推理侧的对应技术是多卡推理与 PD 分离;DeepSeek 等开源模型公开的训练论文里,并行策略与通信优化是核心工程内容。