夜雨聆风学习资料网

ARTICLE · 1029056

AI 疯狂抢电的背后:一文看懂数据中心供配电的「心脏手术」

AI 疯狂抢电的背后:一文看懂数据中心供配电的「心脏手术」

算力基础设施 · 干货

你刷一条短视频、发一条消息、问 AI 一个问题——背后都有一台服务器在某个机房的黑暗里替你拼命。而让它 7×24 小时不死机的,是一套普通人一辈子都见不到的「供电生命线」。今天,我们把它拆开给你看。

一、先看一组让人坐不住的数字

一个 20kW 机柜 ≈ 10 户家庭的用电量而 AI 机柜?轻松突破 100kW,顶得上一栋小居民楼

传统通用服务器机柜功率密度大约 4~8kW。但 AI 时代完全变了:一台 8 卡 GPU 服务器就要 10kW 以上,一个机柜塞 4~6 台,功率直接冲到 60~120kW,最新的 GB200 级别 NVL72 整机柜甚至逼近 120~132kW

一个中型数据中心,动辄就是几万到几十万千瓦的负荷——相当于一座县城的全部用电。电力,已经从「后勤保障」变成了 AI 竞赛的第一瓶颈

业内有句话:以前拼芯片,现在拼网络,未来拼的是。谁能搞到便宜、稳定、绿色的电,谁就掌握了 AI 时代的石油。

而把「电网的电」变成「芯片的电」,中间要经过一条精密到变态的链路。这条链路,就是今天的主角——数据中心供配电系统

二、一条电的「闯关之旅」:从电厂到 GPU

你家的电断了,充个电宝、点个蜡烛就过去了。数据中心的电断 1 秒,可能是上亿级的损失。所以这条链路的每一关,都有「备胎」:

⚡ 第 1 关:市电引入 —— 双路独立电源

来自两个不同的变电站、甚至不同的电网分区,物理上完全隔离。一路断了,另一路毫秒级接管。这就是所谓「双路市电 + 2N 架构」的起点。

⚡ 第 2 关:高压配电 —— 10kV/35kV/110kV 直进机房园区

大型数据中心已经开始直接拉 110kV 专线。电压等级越高,损耗越小、容量越大——这是超大规模 AIDC 的标配。

⚡ 第 3 关:变压器 + 低压配电

把高压变成 400V 给 IT 设备用。注意:变压器也是 N+N 或 2N 冗余,没有单点故障这个词。

⚡ 第 4 关:UPS / HVDC —— 不间断电源,最后的守门员

市电闪断的瞬间,电池顶上。传统 UPS 走「交流→直流→交流」的双变换,效率 94%~96%;而高压直流(HVDC,240V/336V)省掉一次变换,效率冲到 96%~98%。

⚡ 第 5 关:母线 / 列头柜 + 机架 PDU

电最终分到每台服务器。A/B 双路供电到每一颗电源模块,任何一路全挂,设备照常跑。

🔥 终极保命关:柴油发电机

如果市电长时间不来,柴发 10~15 秒内启动,燃油储备支撑 8~72 小时。UPS 撑住「启动间隙」的十几秒,柴发接管「持久战」。

看明白了吗?这套体系的哲学只有一句话:

任何一个环节坏掉,业务都不许中断。

三、供配电的三大流派,你站谁?

流派一:传统 UPS(双变换在线式)—— 老钱的做法

成熟、稳定、生态完善,金融和政企客户的「信仰」。但链路长、损耗大、占地多。效率上到 96% 已经到顶,再多就要看玄学。

流派二:HVDC 高压直流 —— 互联网大厂的性价比之王

少一次变换、少一堆器件,效率更高、占地更小、可靠性反而更好(串联链路越短越可靠)。腾讯、阿里、字节这些年大规模铺开,240V/336V 直流直接进机柜。国内 HVDC 产业链已经全球领先。

流派三:巴拿马电源 /电力模块化 —— 效率卷王

把「中压变压器 + 整流」合二为一,一次侧直接做变换,省掉低压配电环节,系统效率可以做到 98% 以上,占地省一半以上。一个「巴拿马电源」预制模块 = 变压器 + 配电 + 整流 + 监控,现场像搭积木一样建变电站。

方案
系统效率
占地
成熟度
典型场景
传统 UPS 2N
~94-96%
★★★★★
金融 / 政企
HVDC(240V/336V)
~96-98%
★★★★
互联网大厂
巴拿马电源 / 电力模块
~98%+
★★★
超大规模 AIDC

顺便说一个反常识的结论:效率每提升 1 个百分点,一座 100MW 的数据中心一年能省下近 1000 万度电。按 0.6 元/度算,就是近 500 万元——这就是为什么大厂在供配电效率上卷到小数点后两位。

四、AI 把供配电「逼疯」的四个瞬间

如果说过去十年供配电是「稳步进化」,那 AI 就是一脚油门踩死。

① 功率密度爆炸:机柜在「渡劫」

风冷机柜 30kW 就到极限了。之后全是液冷的天下——冷板式、浸没式。而液冷意味着:CDU、泵、冷却液回路全部要电,且绝对不能停。液冷系统断电比服务器断电更可怕——热失控可能直接烧了机柜。于是又多了一类「工艺冷却电」的不间断需求。

② 从「毫秒级」到「秒级」,电源架构开始「减负」

一个正在形成的行业共识:GPU 群对供电中断的容忍度比 CPU 群更高(checkpoint 机制可以接受秒级恢复)。这给了「市电直供 + 部分备电(如 PSU + 锂电池)」这类新架构机会——直接砍掉 UPS/HVDC 大环节,效率冲向 99%+,成本大降。谷歌等厂商早在十年前就开始玩 48V 架构 + 市电直供,如今正成为 AIDC 新标配。

③ 锂电池全面上位

铅酸电池又重又占地,寿命只有 3~5 年。磷酸铁锂电池能量密度高 3 倍、寿命 10 年以上,还支持小颗粒化——锂电池备电 + 削峰填谷 + 需量管理三合一,正在把铅酸挤出机房。电网缺电时,数据中心甚至可以反过来给电网放电(需求响应),赚一份「虚拟电厂」的钱。

④ 绿电 + 源网荷储:数据中心要当「电网公民」

PUE 监管越来越严(东数西算枢纽节点要求 PUE < 1.25 甚至更低),供配电不再是单纯的「可靠性工程」,而是可靠性 + 经济性 + 碳排的三元方程

  • 西北的风光电 + 储能 + 数据中心就地消纳;
  • 算力任务跟着电价走,「电便宜的时候训练,电贵的时候推理」;
  • 余热回收供暖、液冷 + 燃料电池、核能小型堆(SMR)……国外云巨头已经开始为 AI 数据中心直接锁核电。

五、举个完整的例子:一座 30MW AI 园区的典型供电方案

讲了这么多概念,我们来落地一次。假设你要给一座 AI 算力园区做供电方案,参数如下:

📋 项目输入条件

IT 负荷:30MW(约 750 个 40kW 液冷机柜)

机柜供电:A/B 双路,冷板液冷,CDU 需不间断供电

可靠性等级:A 级(容错),任何单点故障 + 计划检修均不得中断业务

能效目标:PUE ≤ 1.22(满足 GB 40879 及地方要求)

电源架构:336V HVDC 电力模块(2N)+ 锂电备电 + 市电直供

① 主接线图(单线图)

图 1|30MW AI 园区典型 2N 主接线示意(单线图)

看图要点:两条颜色不同的链路(A / B)从市电一路冗余到机柜——主变 2N、10kV 母线分段 + 母联互投、柴发 N+1 并机、HVDC 2N、锂电 BBU、末端 A/B 双路;唯一"共用"的地方是柴发并机母线(但机组本身 N+1)。制冷(CDU/泵组)另走双路 UPS,因为液冷一断电就是热失控。

② 四种工况下,电是怎么切换的

工况
动作顺序
业务影响
正常运行
两路市电各带一半负荷,母联分列;HVDC 整流供电、电池浮充
一路市电失电
母联备自投合闸,另一路带全载,变压器不过载
无(毫秒级)
两路市电全停
HVDC 电池无缝放电 → 柴发 10~15s 内启动并机 → 分级加载至满负荷
无(依靠 10~15min 备电兜底)
市电恢复 / 计划检修
柴发卸载→退机→市电切入;检修时按「在线维护」流程单侧隔离
无(但必须走操作票 + 演练)

③ 关键设备清单(示意)

设备
典型配置
冗余方式
主变压器
110kV/10kV,2×容量 = 全载
2N(各带 100%)
中压配电柜
10kV 单母线分段 + 母联
双路 + 备自投
柴油发电机
12×2500kW(常用 11 用 1 备)
N+1 并机
储油与补给
日用箱 + 主储罐,按等级与合同配置(常见 12~24h)
双泵双路 + 供油协议
HVDC / 电力模块
336V 整流模块,模块化热插拔
2N 双系统
电池
磷酸铁锂,10~15min 备电(或机柜级 BBU)
2N + BMS 监测
末端配电
智能母线 / 列头柜 + A/B 双路 PDU
双路到设备电源模块
制冷供电
CDU、泵组、末端空调
双路 UPS / 双路市电互投

④ 我们来算一笔账

按平均负载率 85%、年运行 8760 小时、电价 0.6 元/度粗算:

  • IT 年用电 ≈ 30MW × 8760 × 0.85 ≈ 2.23 亿度
  • PUE 1.22 → 全园区年用电 ≈ 2.72 亿度,电费约 1.6 亿元/年
  • 把供电链路效率从 96% 提到 98%:年省约 470 万度 ≈ 280 万元
  • PUE 再降 0.05:年省约 1100 万度 ≈ 670 万元
看懂了吗?供配电省下的每一度电,都是纯利润。这也是为什么大厂愿意为「效率高一个点」的架构多付一次性投资——通常两三年就回本。

六、别光顾着卷效率:规范红线才是第一位

写了这么多架构和效率,最后必须泼一盆冷水:供配电首先是「合规工程」,其次才是「效率工程」。你可以用最激进的架构,但有几条线是碰不得的。下面这张表,建议收藏。

类别
主要标准 / 规范
关键要求(要点摘录)
设计总纲
GB 50174《数据中心设计规范》
GB 55028《特殊设施工程项目规范》
机房分 A(容错)/ B(冗余)/ C(基本)三级;A 级要求全链路 2N 或容错、可在线维护、任何单点故障不影响业务
供配电系统
GB 50052《供配电系统设计规范》GB 50054《低压配电设计规范》
A 级机房按一级负荷中特别重要负荷供电;双路电源 + 应急电源(UPS/柴发)
不间断电源
YD/T 1095《通信用 UPS》
UPS 电池后备时间一般不宜小于 15 分钟(需覆盖柴发启动与切换)
直流供电
YD/T 2378(240V 直流)YD/T 3088(336V 直流)
直流系统绝缘监测、接地方式、均浮充管理均有明确指标,不能「自己看着办」
备用电源
GB 50174 相关条文GB 51348《民用建筑电气设计标准》
柴发需在十几秒内带载;燃油储备按等级与合同配置(常见 8~24h 或更长);需定期带载测试
电池
YD/T 799(铅酸)YD/T 2344(磷酸铁锂)
锂电需配 BMS、温度与消防监测;电池室防爆、通风、承重、抗震一个都不能少
能效
GB 40879《数据中心能效限定值及能效等级》
GB/T 32910.3(PUE 测量方法)
PUE 为强制性能效限定值指标,等级不达标项目过不了验收;PUE 必须按统一口径测量
电能质量
GB/T 14549(谐波)GB/T 15543(三相不平衡)GB/T 12325(电压偏差)
UPS/HVDC 谐波治理、功率因数、零地电压(运维常按 ≤1V 管控)需实测达标
防雷接地
GB 50057、GB 50343
联合接地、等电位连接,接地电阻与浪涌保护分级配置
消防与安防
GB 50016、GB 50370(气体灭火)GB/T 22239《等保 2.0》
电池室/柴发间独立防火分区与气体灭火;等保要求冗余供电线路 + 短期备用电力
抗震
GB 50981《建筑机电工程抗震设计规范》
母线、桥架、柴发、电池架均需抗震支吊架
施工与验收
GB 50462《数据中心基础设施施工及验收规范》
单机调试 → 联调 → 假负载满载测试 → 切换测试,全过程留档
运行维护
GB/T 51313《数据中心基础设施运行维护标准》
巡检、演练、应急预案、变更管理形成制度与记录

注:以上为要点归纳,项目以标准最新有效版本及地方规定、合同约定为准。

验收和巡检时最容易被卡住的 7 件事

  1. 假负载没做满。
    柴发、UPS 只在 30% 负载下跑一圈不算数,必须按规范做阶梯加载和满负荷测试。
  2. 切换时序没测。
    市电失电 → UPS 放电 → 柴发启动 → 并机带载,每一步的时间戳都要实测留证据。
  3. 电池「装完就算完」。
    容量核对性放电试验、内阻测试缺失,是事故第一大来源。
  4. 零地电压、谐波超标。
    设备一上电就莫名重启,八成是电能质量没管。
  5. 锂电消防照搬铅酸方案。
    电池室防爆、热失控预警、灭火介质选型不能省。
  6. 线缆与端子。
    扭矩没按要求紧固、标识缺失、桥架超载,红外测温一测一个准。
  7. 文档与演练。
    单线图、操作票、应急预案、年度演练记录——没有这些,验收和等保都过不了。
一句话:架构可以创新,规范必须闭环。所有「我觉得没问题」的地方,最后都要变成「测试报告显示没问题」。

七、说点实在的:给从业者的一句话总结

如果用一段话概括未来五年数据中心供配电的走向,那就是:

中压直进、直流化、模块化、预制化、锂电化、智能化。

链路越短越好,变换越少越好,设备越「即插即用」越好,每一度电都精打细算、可观测、可调度;而规范、测试与文档,是这一切的前提。UPS 不会消失,但「市电直供 + 分布式备电」的混合架构一定会吃掉越来越多的份额。而液冷带来的「冷却不间断」需求,会成为下一个被忽视的坑。

最后留一个问题:当单个机柜功率突破 500kW、单个园区负荷超过 1GW(没错,国外已经在规划),供配电还需要「机柜」这个概念吗?还是说,未来的数据中心会变成一座发电厂隔壁的芯片仓库

评论区聊聊:你所在的机房,用的是 UPS、HVDC 还是巴拿马电源?踩过哪些坑?

相关学习资料

返回首页浏览学习资料