🌐

分布式训练(Distributed Training)

Distributed Training
技术原理
训练算力

分布式训练(Distributed Training)指把模型训练任务拆分到多张 GPU/多台机器上并行进行。单卡显存和算力远不够训练千亿参数模型,分布式训练是“拼图”式的解决方案。

核心并行策略

  • 数据并行(DP):每张卡放完整模型副本,各自吃不同批次数据,再同步梯度。最简单常用
  • 张量并行(TP):把单层的权重矩阵切开,多卡合力算一层。通信频繁,一般限于机内 NVLink
  • 流水线并行(PP):按层切分,不同卡负责不同层段,像流水线一样接力
  • 专家并行(EP):MoE 模型把不同专家分布在不同卡上
  • ZeRO / FSDP:把优化器状态、梯度、参数分片到各卡,大幅省显存

现实组合

训练一个千亿模型通常“多维混合并行”——机内张量并行 + 跨机流水线 + 全局数据并行,配合高速互联(InfiniBand / NVLink)。

延伸

推理侧的对应技术是多卡推理与 PD 分离;DeepSeek 等开源模型公开的训练论文里,并行策略与通信优化是核心工程内容。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0