ARTICLE · 1052122
AI数据中心液冷技术:从风冷到芯片级液冷

人工智能和高性能计算正在改变数据中心的计算密度,也在重新定义散热基础设施的设计边界。随着GPU、CPU及其他加速器持续提升计算性能,单台服务器的功耗不断增加,高功率设备在机架中的集中部署进一步推高了局部热负荷。 过去,数据中心主要依靠空气流动将服务器产生的热量带离设备,再通过机房级制冷系统完成整体散热。这种方式技术成熟、部署体系完善,在传统企业IT、通用计算和中低密度服务器环境中仍具有较高适用性。但对于人工智能训练、推理以及高性能计算等持续高负载场景,单纯依靠空气输送热量正面临越来越明显的效率和密度限制。 因此,数据中心冷却技术正在从“降低机房环境温度”逐步转向“直接控制芯片热量”。以冷板为代表的芯片级直接液冷(Direct-to-Chip,DTC)通过缩短热量传递路径,将冷却能力直接部署到CPU、GPU等主要热源附近,成为高密度计算基础设施的重要发展方向。
高密度计算为什么改变了冷却逻辑
数据中心的冷却问题,本质上是计算功率向热能转化后的热量如何被持续、稳定地带走。 传统服务器的功耗相对分散,机架内部的热负荷通常可以通过合理的冷热通道设计、服务器风扇以及CRAC或CRAH系统进行管理。但AI服务器往往集成大量高性能GPU或其他加速器,计算资源更加集中,单位机架产生的热量明显增加。 这带来了三个直接变化。 首先,热量更加集中。传统服务器可以依靠大量空气完成散热,而高性能GPU的热量主要集中在有限的芯片区域,热流密度明显提高。 其次,机架功率持续提升。当更多加速器被部署在同一机架中,服务器产生的总热量同步增加。即使机房整体温度保持在合理范围内,机架内部局部热管理仍可能成为限制因素。 再次,冷却系统本身的能耗开始受到更多关注。如果需要不断增加风量、提升风扇转速、扩大制冷设备规模来应对IT负载增长,那么冷却系统占数据中心总能耗的比例也可能随之上升。 因此,高密度AI基础设施的冷却问题已经不只是“如何降低温度”,而是如何在有限的电力、空间和基础设施条件下,将更多计算能力稳定地部署到单位机架和单位面积中。
风冷仍然重要,但适用边界正在变化
空气冷却并没有因为液冷的发展而失去价值。相反,在大量数据中心环境中,风冷依然是最成熟、最容易维护的散热方式。 典型风冷系统的热传递路径为: 芯片→散热器→服务器内部空气→机架气流→冷热通道→CRAH/CRAC→制冷系统 这种架构的优势在于标准化程度高,服务器和机房之间具有较成熟的配套体系。对于功率密度较低的设备,风冷仍然能够提供稳定的散热能力。 但随着机架功率不断提升,空气作为传热介质的物理特性开始成为重要约束。 空气密度低、单位体积携带热量的能力有限。要带走更多热量,就需要更大的空气流量,而增加空气流量意味着更高的风扇功耗、更复杂的气流组织以及更大的机房制冷能力。 当高功率设备集中在有限空间内时,冷却系统甚至可能需要同时解决局部热点、机架进风温度、机柜气流短路以及冷却能力分配等问题。 因此,未来的数据中心并不是简单地从“风冷时代”进入“液冷时代”,而更可能形成风冷与液冷长期共存、根据热负荷进行分层配置的架构。
芯片级液冷改变了热量传递路径
直接芯片液冷的核心变化,并不是简单地把空气换成液体,而是重新设计热量从芯片到设施侧的传递路径。 在典型的DTC液冷架构中,冷却液通过管路进入服务器内部的冷板。冷板与CPU、GPU等高功率芯片形成高效的热传递界面,液体吸收芯片产生的热量后进入回路,再通过机架侧或设施侧的冷却液分配单元(CDU)将热量传递至更大的散热系统。 其基本路径可以概括为: 芯片→冷板→冷却液→CDU→设施侧换热系统→室外散热 与风冷相比,液冷最大的结构性优势是将热量捕获点从机房空气层前移到了芯片附近。 这意味着大量热量不再需要首先释放到服务器周围的空气中,再由空气带走,而是在热源附近直接进入液体回路。 对于高热流密度的GPU和CPU而言,这种架构更符合高密度计算的发展方向。
为什么液体更适合高热密度芯片
液冷能够支持高密度计算,一个重要原因来自空气和水基冷却液在热物性方面的差异。 在接近室温的条件下,空气密度约为1.2千克/立方米,比热容约为1.0kJ/kg·K,因此体积热容约为1.2kJ/m³·K。 水的密度约为1000千克/立方米,比热容约为4.18kJ/kg·K,对应的体积热容约为4.18MJ/m³·K。 这意味着,在相同温升条件下,单位体积的水能够携带的热量远高于空气。
实际液冷系统并不一定直接使用纯水,而是根据系统设计、温度范围、材料兼容性以及水质管理要求选择相应的水基冷却液或其他工作流体。 从工程角度看,液冷的价值并不只是“液体比空气更能带热”,更重要的是它能够以较小的流量将热量从高热流密度区域快速转移出去,从而降低对大规模空气流动的依赖。
液冷如何降低冷却系统压力
液冷首先减少的是服务器内部和机架周围对大量空气流动的依赖。 在高密度风冷系统中,服务器风扇需要推动大量空气经过散热器。随着芯片功耗增加,风扇功耗和气流需求也会增加。 DTC液冷则将主要热量直接交给冷却液处理。对于采用混合散热架构的服务器而言,GPU和CPU等高功率器件使用冷板液冷,内存、硬盘、电源模块以及其他低热负荷部件仍可以采用空气冷却。 这种方式并不是完全取消空气,而是将不同热密度的组件交给更适合的冷却方式处理。 因此,未来高密度AI服务器更可能采用混合冷却,而不是所有部件都进行液冷。
更高的机架密度成为液冷的重要价值
液冷还能降低部分冷却能耗
液冷系统并不意味着冷却能耗自动下降,其实际效果取决于系统架构、冷却液温度、泵功率、CDU效率以及设施侧散热方式。 但从系统结构看,DTC液冷可以减少服务器风扇和大规模空气输送所需的能耗。 与此同时,如果设施采用较高温度的液体回路,并结合自然冷却或干式冷却器等方案,还可以减少部分机械制冷需求。 在合适的气候和设施条件下,这种设计还有机会降低蒸发冷却带来的水资源消耗。 需要注意的是,“液冷节能”不能简单理解为所有液冷数据中心都一定比风冷系统节能。液冷系统新增了泵、CDU、管路、换热器等设备,这些设备同样需要消耗能源。因此,评价液冷效果应关注整个冷却链路,而不是单独比较冷板或服务器风扇。从单机架升级到完整液冷基础设施
高密度液冷的部署也意味着数据中心基础设施需要同步变化。 传统风冷系统主要关注冷热通道、送风量、回风温度以及CRAC/CRAH容量。而液冷系统需要进一步考虑:冷却液温度和流量; CDU容量及冗余设计; 机架歧管和快速接头; 管路布局与维护空间; 冷却液品质与过滤; 泄漏检测; 冷板与芯片之间的热界面; 设施侧换热能力; 泵送功耗; IT设备与液冷基础设施之间的接口标准。这意味着液冷不再只是服务器厂商需要解决的问题,而是涉及IT设备、机架、配电、管路、CDU、制冷设备以及数据中心建筑基础设施的系统工程。
液冷部署需要关注可靠性与维护
风冷与液冷将长期共存
从数据中心实际建设情况来看,未来并不会形成一种技术完全替代另一种技术的局面。 对于普通企业服务器、网络设备、存储设备以及较低功率密度的IT设备,风冷依然具有较高的经济性和成熟度。 对于高功率GPU服务器、高性能计算节点以及持续运行的大规模AI集群,液冷的优势则更加明显。 因此,更合理的方向是根据不同设备的热负荷建立分层冷却体系:这种混合模式可以避免为了少量高功率设备而对整个数据中心进行完全液冷改造,同时也能够为未来高密度计算设备预留升级空间。
冷却架构将成为AI数据中心设计的核心指标
过去的数据中心设计通常围绕机架空间、电力、网络和存储容量展开,而AI基础设施的发展正在把冷却能力提升到同等重要的位置。 未来的数据中心建设,需要在服务器采购之前就确定机架功率密度、冷却方式、供电能力和网络架构之间的关系。 对于新建AI数据中心,可以从规划阶段直接设计液冷管路、CDU空间、机架接口和设施侧换热能力。 对于已经运行的传统数据中心,则更适合采用渐进式方式,根据高功率机架的部署位置和实际热负荷进行局部液冷改造,而不是一次性改变整个机房的冷却体系。 这种方式能够降低改造复杂度,也更符合现有数据中心逐步增加AI计算能力的发展路径。