2.2.1 系统架构全景图

2.2.2 子系统间的依赖关系:最短的木板决定系统性能
一、关键依赖链路:从存储到计算的完整数据流

①第一阶段:从存储到CPU内存的数据加载
②第二阶段:从CPU内存到GPU显存的数据传输
③第三阶段:GPU显存上的计算执行
④第四阶段:从GPU计算到跨节点网络通信
二、瓶颈传导效应:短板如何拉低全局性能
①存储子系统性能不足引发的GPU空闲与MFU下降
②内存带宽不足导致的数据流水线阻塞
③显存容量不足引发的ZeRO通信增加与计算拖慢
④网络延迟增加导致的集群效率下降
⑤散热能力不足导致的GPU降频与训练时间延长
三、架构师洞察:投资平衡的艺术
典型案例对比:集群A(均衡型)与集群B(失衡型)
设计原则总结:
2.2.3 子系统间的设计权衡:没有最优,只有最合适
设计决策矩阵:
部署密度 | 单机架功耗 | 散热方案 | 适用场景 |
每柜1台(8卡) | 8-12kW | 风冷可行,边缘 | 小规模部署,无液冷条件 |
每柜2台(16卡) | 16-24kW | 必须液冷 | 中等规模,有液冷基础设施 |
每柜4台(32卡) | 32-48kW | 液冷+高密度布局 | 大规模集群,追求极致密度 |
架构师的选择逻辑:
② 更大显存与更快显存:容量与带宽的取舍
③ 更高网络带宽与成本:通信效率与预算的平衡
④ 液冷与风冷:效率与复杂性的对决
维度 | 液冷 | 风冷 |
散热能力 | 150kW+/柜 | 15kW/柜上限 |
PUE | 1.05-1.15 | 1.4-1.6 |
初期投资 | 高(+15-25%) | 低 |
运维复杂度 | 高(防泄漏、水质管理) | 低 |
GPU降频风险 | 几乎为零 | 高密度部署时显著 |
机房改造需求 | 需水冷基础设施 | 标准空调即可 |
夜雨聆风