万卡集群(10K-GPU Cluster)指由一万张及以上GPU(或AI加速卡)组成的大规模计算集群,是大模型进入千亿甚至万亿参数时代后的标配训练设施。
为什么要建万卡集群
- 大模型参数量越大,所需算力越高,单卡训练耗时以年计
- 把训练任务拆分到上万张卡上并行计算,才能把训练周期压缩到数周或数月
- 多卡并行是大规模训练唯一现实的路径
关键技术挑战
- 网络:卡间通信带宽决定并行效率,需要高速互联与低延迟组网
- 稳定性:万卡规模下硬件故障频繁,需要断点续训与故障自愈机制
- 调度:作业调度、负载均衡与算力利用率优化
- 存储:海量训练数据与模型checkpoint对存储系统提出极高要求
代表实践
- 全球主流云厂商均已建成万卡级训练集群
- 国内头部大模型团队已具备稳定运行万卡集群的能力,并将其视为核心竞争力之一
意义
万卡集群不只是堆硬件,更比拼网络、调度、容错等系统工程能力,是衡量AI基础设施水平的重要标志。