万卡集群

围绕能耗极限、网络瓶颈、计算效率、系统可靠性展开

面临的挑战

超万卡 GPU/NPU 大规模 AI 集群

  • 大容量:算力容量 >5000P,存储资源池 >200P,交换机 ~1000台

  • 多设备:N 个机房 >1000 机柜(5000台设备)

  • 多线缆:>10w 光模块布线,>8W根数据线缆,>20W个接头,~8W 焙纤端子

参与方多,实施强交叉,工期紧机房准备度低

  • 参与万众多:设计院、研发部、云管中心、设备供应商、第三方设备厂商、土建方

  • 基建重叠:L1/L2 交叉实施 ~X 个月

能耗密度突破物理极限,电力供应与散热挑战高

  • 单节点能耗高:单卡能耗 350W,单节点 3000W,单柜 20kW

  • 多设备集中:N 个机房 >1000 机柜(5000台设备),地理位置集中

万卡互联的网络通信带宽与延迟瓶颈

  • 多层互联:交换机 ~1000台,框框、盒盒盒多层互联结构

  • 通信算法:集合通信、点对点通信超规模后 Ring、Have Doubling 回环时间长

计算效率提升,万卡规模互联算力损耗难题

  • AI 节点: >2000 节点,AI 卡数 ~16000

  • 存储容量: ~800 ROCE 交换机

  • 大模型: PyTorch + Megatron + Dense/MoE 从十以到千亿规模训练测试,万卡集群 K8S 调度

系统可靠性,故障率指数级上升

国产化挑战:生态与性能的双重差距

成本与运营:千亿级投资的商业风险

能耗极限

万卡建设能耗现状:

  • 单节点能耗高:单卡能耗 350W,单节点 3000W,单柜 20kW

  • 多设备集中:N 个机房 >1000 机柜(5000台设备),地理位置集中

超高功耗需求:

  • 高耗电:10 万张 H100 GPU 集群 IT 功耗 >150MW,e.g. 相当于小型城市的峰值用电,年耗电量 ~1.59 太

瓦时,电费成本超 1.2 亿美元/年。

  • 单机柜功率密度飙升:NVIDIA 的 NVL72 机柜功耗达 120kW(a.k.a. 冗余后198kW),液冷成为强制选项

液冷、功耗、器件相互影响

供电架构重构:

  • 供电方案:传统 12V 供电链路损耗过高,48V 直连方案(e.g. OCP 标准)成为主流,但仍需解决高电流 (>1000A/芯片)下的电压转换效率问题
  • 新架构:Vicor 等厂商提出“垂直供电架构”(VPD),通过分比式电源(FPA)将电流倍增模块嵌入处 理器下方,减少PCB传输损耗 95%

液冷协同设计

  • 定制化:高密度机柜需定制密封式液冷管道,防止冷却液渗漏导致电气短路
  • 协同优化:液冷系统占数据中心总能耗 ~40%,需与配电网络协同优化

网络通信

万卡互联的网络通信带宽与延迟瓶颈

万卡建设互联现状:

  • 多层互联:交换机 ~1000台,框框、盒盒盒多层互联结构,多层交换拓扑
  • 通信算法:集合通信、点对点通信超规模后 Ring、Have Doubling 回环时间长 超大规模组网复杂度:
  • 成本增加:光模块成本激增,10 万 AI 集群需 ~10 万个光模块,长距单模式光模块成本是多模 10 倍
  • InfiniBand 等协议:低延迟但扩展性差,超10万卡时需4层交换机,成本高昂

计算效率

万卡建设计算效率现状:

  • AI 节点:>2000 节点,AI 卡数 ~16000
  • 存储容量:~800 ROCE 交换机
  • 大模型:PyTorch + Megatron + Dense/MoE 从十亿到千亿规模训练测试,万卡集群 K8S 调度

提升有效计算率 MFU:

  • 千卡集群 MFU ~40-50%,但万卡因通信延迟和同步开销,特别是面向 MoE 稀疏模型 MFU 将至 35%
  • 混合专家模型(MoE)需All-to-All通信,加剧带宽压力;

分布式训练策略

  • 字节跳动 MegaScale 通过 3D 并行优化和计算+通信重叠技术,在 1.2W 集群上 MFU 提升 ~55.2%
  • 摩尔线程“夸娥集群”采用自适应混合并行策略,支持显存池化管理,减少I/O瓶颈

DeepSeek 性能优化方案

  • GEMM FP8:通过 FP8 通用矩阵乘法库,利用 Tensor Core 加速和 JIT 优化,同时通过 CUDA-core 二级累加 技术缓解精度损失。
  • Dual Pipe:双向流水线并行架构,将 Forward 与 Backward 计算过程重叠执行,并通过硬件级调度隐藏通 信开销。

image-20250906115530695

系统可靠性

硬件故障常态化

  • 10 万 GPU 集群日均故障 GPU 超 50 张,单卡故障可导致整个训练任务中断
  • 传统故障定位需 1-2 天,复杂故障达数十天,训练中断损失巨大

快速恢复机制

  • 设计分钟级故障定位+断点续训方案,通过 Kubernetes 自动驱逐故障节点,秒级内切换备份节点
  • 通过全栈运行时打点技术,将故障恢复时间压缩至分钟级,提升训练有效率

集群建设

image-20250906121714017

image-20250906121800958

image-20250906122755764

机房布局

  • 机房主要用于安装主通信设备、通信传输设备、电源等配套设备。
  • 为维护和管理上的方便,要求上述设备安排紧凑,并按业务类别不同分别安装在不同的房间。

  • 整体布局 :优先采用单层集中式布局,保障通信效率与运维便捷,其次才是多层和多栋。
  • 功能分区 :核心设备居中部署,辅助区域环绕四周,满足高密度配电与制冷需求。
  • 机柜扩容 :机房预留扩展空间,支持分阶段部署,提升灵活扩展能力。
  • 供电设计 :供电系统分为左右两区,就近供电, 避免跨层布线。
  • 制冷管理 :采用冷热通道隔离和增强散热措施,确保高密GPU集群稳定运行。

布线

  • 跨层布线分区管理 :按楼层划分光迁区域,避免跨区布线混乱,提升维护效率。
  • 就近穿层布线 :光缆穿层路径应最短化,避免绕线,降低延迟和损耗。
  • 双层光迁桥架设计 :利用柜间空间设置上下两层桥架,满足高密度布线与冗余部署需求。

配电制冷架构

  • 挑战:十万卡AI 集群功耗近 XXXMW。供电投资大(~30%to40% 基建),占地多(~20%to30% 辅助区)
  • 选址建议:电力充足、电价低的地方;气候凉爽,利于自然降温;有扩展空间,方便以后扩容;靠近数据中心聚集区,便于资源共享。
  • 单路供电方案:用一路高质量市电直供,配合UPS或储能系统;省去冗余供电线路,降低初期投资和运维复杂度;适合对可靠性要求不是极端苛刻的AI训练场景。

光链路脏污

image-20250906122610860

image-20250906122645517

1. 物理隔离层:施工防护

  • 光模块真空封装:出厂时充氮密封,拆封即插,避免存储/运输污染

  • 光纤端面防尘帽:弹簧自锁式设计(IP6X 防尘),插拔暴露时间<0.5秒

  • 无尘操作舱:百级洁净环境(≥0.3μm 颗粒 ≤100/m³),施工污染风险 ↓99%

2. 主动防御层:环境控制

  • 机房正压通风:维持室内气压>外部 5Pa,气流屏障阻隔外部粉尘

  • H14 级空气过滤:ULPA 超高效过滤(99.999% @0.1μm),机房 PM1.0 浓度<10μg/m³

交付测试

测试步骤(测试准备、测试原则、测试步骤)

性能测试方案(模型、性能、线性度、集合通讯)

测试前准备

  • 准备大模型镜像,包含模型文件 + 脚本 + CUDA/CANN + Megatron 等相关软件。
  • 准备数据集,因为面向集群性能和长稳摸高测试,可直接使用模型开源数据集。
  • 准备模型训练使用脚本,明确脚本中关于模型训练相关的超参,特别是并行策略

image-20250906124412090

测试策略

  • 测试任务由小到大,由易到难,先功能再性能,先测峰值再测长稳。

  • 先从小规模集群开始罚试,由小到大,稳步攀升到万卡

做好故障冗余备份

备份方式:进行 2K 节点测试时,先准备 2K+X 节点,X 作为备用节点,当 2K 节点出现故障节点时,立即使用 X 备用节点进行替换。既不影响 2K 节点训练测试,也可对故障节点快速隔离定界

定位。

  • 2K+X 节点准备好后进行训前检查,保障测试环境处于健康状态。所有节点完成巡检后,按训练脚本正式启动模型训练测试。

  • 训练过程报错,找到首报错节点导出首报错节点日志,分析失败原因。同时从 X 节点选备用节点替换报错节点,让训练任务重新拉起。

  • 完成所有训练迭代后,导出日志进行训练测试结果分析和输出测试报告。

image-20250906125448905

测试方案

模型测试

  • 模型按照参数量和匹配的计算节点数递增,并提供 Dense 类模型和 MoE 稀疏类模型

    image-20250906125802673

  • 根据不同的并行策略、序列长度、GBS 来递增计算节点,测试其他性能指标

    image-20250906125823898

集合通信测试

image-20250906130110842

image-20250906130232391

线性度测试

在万卡 AI 集群中评估通信的线性度 Scaling Linearity,是为了衡量随着集群规模扩大时,通信效率是否保持理想比例提升或下降。好的通信线性度意味着集群规模增长能够有效扩展,反之说明存在通信瓶颈、网络拥塞、协议限制等问题。

image-20250906165042621

image-20250906165102485

集群可靠性压力测试,充分挖掘硬件故障

长周期连续训练稳定性测试

分布式训练线性度与扩展性测试

自动化监控与告警体系建设

训练任务失败归因分析机制建立