围绕能耗极限、网络瓶颈、计算效率、系统可靠性展开
面临的挑战
超万卡 GPU/NPU 大规模 AI 集群
-
大容量:算力容量 >5000P,存储资源池 >200P,交换机 ~1000台
-
多设备:N 个机房 >1000 机柜(5000台设备)
-
多线缆:>10w 光模块布线,>8W根数据线缆,>20W个接头,~8W 焙纤端子
参与方多,实施强交叉,工期紧机房准备度低
-
参与万众多:设计院、研发部、云管中心、设备供应商、第三方设备厂商、土建方
-
基建重叠:L1/L2 交叉实施 ~X 个月
能耗密度突破物理极限,电力供应与散热挑战高
-
单节点能耗高:单卡能耗 350W,单节点 3000W,单柜 20kW
-
多设备集中:N 个机房 >1000 机柜(5000台设备),地理位置集中
万卡互联的网络通信带宽与延迟瓶颈
-
多层互联:交换机 ~1000台,框框、盒盒盒多层互联结构
-
通信算法:集合通信、点对点通信超规模后 Ring、Have Doubling 回环时间长
计算效率提升,万卡规模互联算力损耗难题
-
AI 节点: >2000 节点,AI 卡数 ~16000
-
存储容量: ~800 ROCE 交换机
-
大模型: PyTorch + Megatron + Dense/MoE 从十以到千亿规模训练测试,万卡集群 K8S 调度
系统可靠性,故障率指数级上升
国产化挑战:生态与性能的双重差距
成本与运营:千亿级投资的商业风险
能耗极限
万卡建设能耗现状:
-
单节点能耗高:单卡能耗 350W,单节点 3000W,单柜 20kW
-
多设备集中:N 个机房 >1000 机柜(5000台设备),地理位置集中
超高功耗需求:
- 高耗电:10 万张 H100 GPU 集群 IT 功耗 >150MW,e.g. 相当于小型城市的峰值用电,年耗电量 ~1.59 太
瓦时,电费成本超 1.2 亿美元/年。
- 单机柜功率密度飙升:NVIDIA 的 NVL72 机柜功耗达 120kW(a.k.a. 冗余后198kW),液冷成为强制选项
液冷、功耗、器件相互影响
供电架构重构:
- 供电方案:传统 12V 供电链路损耗过高,48V 直连方案(e.g. OCP 标准)成为主流,但仍需解决高电流 (>1000A/芯片)下的电压转换效率问题
- 新架构:Vicor 等厂商提出“垂直供电架构”(VPD),通过分比式电源(FPA)将电流倍增模块嵌入处 理器下方,减少PCB传输损耗 95%
液冷协同设计
- 定制化:高密度机柜需定制密封式液冷管道,防止冷却液渗漏导致电气短路
- 协同优化:液冷系统占数据中心总能耗 ~40%,需与配电网络协同优化
网络通信
万卡互联的网络通信带宽与延迟瓶颈
万卡建设互联现状:
- 多层互联:交换机 ~1000台,框框、盒盒盒多层互联结构,多层交换拓扑
- 通信算法:集合通信、点对点通信超规模后 Ring、Have Doubling 回环时间长 超大规模组网复杂度:
- 成本增加:光模块成本激增,10 万 AI 集群需 ~10 万个光模块,长距单模式光模块成本是多模 10 倍
- InfiniBand 等协议:低延迟但扩展性差,超10万卡时需4层交换机,成本高昂
计算效率
万卡建设计算效率现状:
- AI 节点:>2000 节点,AI 卡数 ~16000
- 存储容量:~800 ROCE 交换机
- 大模型:PyTorch + Megatron + Dense/MoE 从十亿到千亿规模训练测试,万卡集群 K8S 调度
提升有效计算率 MFU:
- 千卡集群 MFU ~40-50%,但万卡因通信延迟和同步开销,特别是面向 MoE 稀疏模型 MFU 将至 35%
- 混合专家模型(MoE)需All-to-All通信,加剧带宽压力;
分布式训练策略
- 字节跳动 MegaScale 通过 3D 并行优化和计算+通信重叠技术,在 1.2W 集群上 MFU 提升 ~55.2%
- 摩尔线程“夸娥集群”采用自适应混合并行策略,支持显存池化管理,减少I/O瓶颈
DeepSeek 性能优化方案
- GEMM FP8:通过 FP8 通用矩阵乘法库,利用 Tensor Core 加速和 JIT 优化,同时通过 CUDA-core 二级累加 技术缓解精度损失。
- Dual Pipe:双向流水线并行架构,将 Forward 与 Backward 计算过程重叠执行,并通过硬件级调度隐藏通 信开销。

系统可靠性
硬件故障常态化
- 10 万 GPU 集群日均故障 GPU 超 50 张,单卡故障可导致整个训练任务中断
- 传统故障定位需 1-2 天,复杂故障达数十天,训练中断损失巨大
快速恢复机制
- 设计分钟级故障定位+断点续训方案,通过 Kubernetes 自动驱逐故障节点,秒级内切换备份节点
- 通过全栈运行时打点技术,将故障恢复时间压缩至分钟级,提升训练有效率
集群建设



机房布局
- 机房主要用于安装主通信设备、通信传输设备、电源等配套设备。
-
为维护和管理上的方便,要求上述设备安排紧凑,并按业务类别不同分别安装在不同的房间。
- 整体布局 :优先采用单层集中式布局,保障通信效率与运维便捷,其次才是多层和多栋。
- 功能分区 :核心设备居中部署,辅助区域环绕四周,满足高密度配电与制冷需求。
- 机柜扩容 :机房预留扩展空间,支持分阶段部署,提升灵活扩展能力。
- 供电设计 :供电系统分为左右两区,就近供电, 避免跨层布线。
- 制冷管理 :采用冷热通道隔离和增强散热措施,确保高密GPU集群稳定运行。
布线
- 跨层布线分区管理 :按楼层划分光迁区域,避免跨区布线混乱,提升维护效率。
- 就近穿层布线 :光缆穿层路径应最短化,避免绕线,降低延迟和损耗。
- 双层光迁桥架设计 :利用柜间空间设置上下两层桥架,满足高密度布线与冗余部署需求。
配电制冷架构
- 挑战:十万卡AI 集群功耗近 XXXMW。供电投资大(~30%to40% 基建),占地多(~20%to30% 辅助区)
- 选址建议:电力充足、电价低的地方;气候凉爽,利于自然降温;有扩展空间,方便以后扩容;靠近数据中心聚集区,便于资源共享。
- 单路供电方案:用一路高质量市电直供,配合UPS或储能系统;省去冗余供电线路,降低初期投资和运维复杂度;适合对可靠性要求不是极端苛刻的AI训练场景。
光链路脏污


1. 物理隔离层:施工防护
-
光模块真空封装:出厂时充氮密封,拆封即插,避免存储/运输污染
-
光纤端面防尘帽:弹簧自锁式设计(IP6X 防尘),插拔暴露时间<0.5秒
-
无尘操作舱:百级洁净环境(≥0.3μm 颗粒 ≤100/m³),施工污染风险 ↓99%
2. 主动防御层:环境控制
-
机房正压通风:维持室内气压>外部 5Pa,气流屏障阻隔外部粉尘
-
H14 级空气过滤:ULPA 超高效过滤(99.999% @0.1μm),机房 PM1.0 浓度<10μg/m³
交付测试
测试步骤(测试准备、测试原则、测试步骤)
性能测试方案(模型、性能、线性度、集合通讯)
测试前准备
- 准备大模型镜像,包含模型文件 + 脚本 + CUDA/CANN + Megatron 等相关软件。
- 准备数据集,因为面向集群性能和长稳摸高测试,可直接使用模型开源数据集。
- 准备模型训练使用脚本,明确脚本中关于模型训练相关的超参,特别是并行策略

测试策略
-
测试任务由小到大,由易到难,先功能再性能,先测峰值再测长稳。
-
先从小规模集群开始罚试,由小到大,稳步攀升到万卡
做好故障冗余备份
备份方式:进行 2K 节点测试时,先准备 2K+X 节点,X 作为备用节点,当 2K 节点出现故障节点时,立即使用 X 备用节点进行替换。既不影响 2K 节点训练测试,也可对故障节点快速隔离定界
定位。
-
2K+X 节点准备好后进行训前检查,保障测试环境处于健康状态。所有节点完成巡检后,按训练脚本正式启动模型训练测试。
-
训练过程报错,找到首报错节点导出首报错节点日志,分析失败原因。同时从 X 节点选备用节点替换报错节点,让训练任务重新拉起。
-
完成所有训练迭代后,导出日志进行训练测试结果分析和输出测试报告。

测试方案
模型测试
-
模型按照参数量和匹配的计算节点数递增,并提供 Dense 类模型和 MoE 稀疏类模型

-
根据不同的并行策略、序列长度、GBS 来递增计算节点,测试其他性能指标

集合通信测试


线性度测试
在万卡 AI 集群中评估通信的线性度 Scaling Linearity,是为了衡量随着集群规模扩大时,通信效率是否保持理想比例提升或下降。好的通信线性度意味着集群规模增长能够有效扩展,反之说明存在通信瓶颈、网络拥塞、协议限制等问题。


集群可靠性压力测试,充分挖掘硬件故障
长周期连续训练稳定性测试
分布式训练线性度与扩展性测试
自动化监控与告警体系建设
训练任务失败归因分析机制建立