夜雨聆风学习资料网

ARTICLE · 1122711

超节点:AI 的下一个战场,不在芯片上

超节点:AI 的下一个战场,不在芯片上

一个 AI 机柜,功率 120 千瓦。

120 千瓦是什么概念?一台家用空调大概 300 瓦。也就是说,你眼前这一个柜子,等于同时开着 400 台空调,而且还得给这 400 台单独配一套空调系统。

过去两年,全球的钱都在抢 GPU。但真正卡住 AI 的东西,早就不是芯片了。

就在前两个月,中金连着发了两篇研报,

中金 | 国产算力系列二:超节点为算力演进必由之路,重塑互联、液冷与电源需求

把这件事讲得很透。一篇讲超节点是什么、值多少钱,一篇讲超节点会把哪些环节的钱赚走。

我把两篇合在一起讲,也讲讲哪些地方站不住。


一、超节点不是"更好的方案",是唯一能装得下的方案

先说清楚超节点是什么。

以前买 AI 服务器,是一张卡一张卡地买,八张卡装一台机器,像八个人挤一间办公室。

现在不一样了。现在是把几十上百张卡焊成一个整体,让它们像一台大机器一样干活。这个东西叫超节点。

为什么非这么干不可?

因为模型太大了。

中金在第一篇里举了个例子,Kimi K3,2.8 万亿参数。就算用 FP4 格式压缩过,显存还要 1.4TB。8 卡服务器装不下,只能往上拼。

这里有个概念得说一下,大模型现在流行一种叫 MoE 的架构,全称混合专家模型。简单说就是模型有一大堆"专家",每次干活只叫其中几个出来。听着省事,但省不了显存——所有专家的参数都得一直躺在内存里备着,动态叫哪个出来、什么时候叫,全 unpredictable。这就像你有一个巨大的图书馆,每次查书都得跑到书架最深处,哪怕只借一本。

所以内存墙、通信墙、计算墙三堵墙一起压过来。

结论是:单卡受限的情况下,把卡组织成超节点,不是"更优的工程选择",是数学上的必然。

规模有多大?中金测算,2026 年国产超节点机柜市场 759 亿元,2027 年 2256 亿元,对应 64 卡规格的机柜出货 0.69 万台到 2.38 万台。

华为的 CloudMatrix 384 是目前唯一有真实交付量的,截至 2026 年 7 月已经商用落地 750 多套。这是整个叙事里最实的一个数字。


二、钱不在芯片上,在"把柜子做出来"这件事上

这是两篇研报最核心的判断,也是最值钱的一句。

超节点一旦成立,服务器的设计逻辑就变了。以前是买卡配机器,现在是把几十张卡、几千根线、上百个供电和散热部件做成一个能整体交付的产品。

这么一改,钱往哪儿跑?

第一个吃到大钱的是交换芯片。

以前一组服务器共用一台交换机,交换网络是机房里的配角。现在交换芯片直接进柜子,每一张算力卡都得单独拉高速链路接进去。

中金算了一笔账:传统三层网络架构下,一张算力卡对应 51.2T 交换芯片大概是 13 比 1;两层架构是 21 比 1。而在超节点里,一颗交换芯片理论上对应 8 张卡。实际方案比理论还激进——阿里 128 卡方案配了 16 个交换节点,字节的 72 卡方案配了 12 个,比例 6 比 1。

也就是说,同样一张算力卡,进超节点要配的交换芯片是原来的 2 到 3 倍。

市场空间:国产超节点柜内交换芯片,2026 到 2028 年从 30 亿涨到 310 亿。配套的交换托盘从 67 亿涨到 683 亿。

第二个是液冷。

前面说的 120 千瓦,不是随口举的数字,是英伟达 GB200 NVL72 的实际整柜功率。产品一代一代往上走:GB200 约 120 千瓦,GB300 约 142 千瓦,下一代 Rubin 直接到 180 到 220 千瓦。

功率这么高,风冷已经压不住了。TrendForce 的数据,AI 数据中心的液冷渗透率从 2024 年的 14% 已经涨到 2026 年的 40%。

还有一个细节值得注意。英伟达 GB200 72 卡参考配置里,被液冷的不只是 CPU 和 GPU,连网卡芯片和交换芯片也给液冷了。也就是说,液冷要覆盖的范围在往外扩,从核心芯片扩到网络和交换部件。这对做液冷的公司是好事——单个机柜里要装的东西变多了。

市场规模:国产超节点液冷配套,2026 年 14 亿,2028 年 148 亿。

第三个是电源。

这个环节最容易被忽略,但逻辑挺硬。超节点里几十上百颗芯片是同步干活的,训练的时候大家一起算、一起等,功率需求不是平滑上升的,是突然冲上去。所以对电源的要求变了:不能只管供电,得管得住波动。

要什么?短时备电的电池模块、冗余电源、智能配电柜。再往远处看,供电架构要从传统 UPS 往高压直流、固态变压器这条路走。


三、这套逻辑,最硬的软肋在哪

讲完好的,该讲不好的了。这部分我觉得比前面更有价值。

第一,这个故事的地基是政策,不是市场。

中金自己的原话是:"在 H20、H200 等海外加速卡仍由于政策原因出口受限的背景下,为确保系统交付能力,国内 CSP 资本开支流向'国产卡+超节点'是必然趋势。"

看清楚这条链子的起点——是被逼出来的,不是主动选的。

那反过来说,如果英伟达高端卡放开卖了呢?CSP 完全可以直接买 GPU 服务器,多简单。超节点那套"单卡不行我拿数量补"的逻辑,根基就松了。

而中金两篇研报加起来列了六条风险,没有一条是出口政策。

第二,算力到底用不用得起来,两篇都没提。

这才是最要命的。

工信部五部门自己的文件里确认,全国算力设施约 30% 闲置,智算中心 GPU 利用率不足 30%。信通院的数据,2025 年算力使用率 36.8%。

一边是 758 亿涨到 2256 亿的机柜市场,一边是三分之一的算力在闲着。这个背离,两篇研报一个字没提。

第三,HBM 这个物理天花板被绕过去了。

超节点的逻辑是"以卡量补单卡"——单卡不行,我多堆卡。可堆卡就要 HBM,长鑫的 HBM3E 良率现在是 25% 到 30%,落后美韩三到五年。这个数字卡的不是某个环节,是整条链的物理上限。

而中金测算 2027 年需要 608 万张国产 AI 芯片,比 IDC 公开预测高了六成。

第四,数字自己就对不上。

第一篇里假设 64 卡机柜单柜 1100 万元,并且"假设年降",但年降多少没写。我拿 1100 万乘 0.69 万台,正好是 759 亿,对得上;乘 2.38 万台,是 2618 亿,但报告写的结论是 2256 亿。

反推一下,2027 年单柜其实是降到了 948 万,降了 13.8%。

这个数挺关键。因为它意味着,柜数翻 3.45 倍,市场规模只涨 1.97 倍,差额全被单柜价值量下降吃掉了。报告标题说"价值量跃升",这里被悄悄抵消掉一块。

第五,交换芯片的规模在报告里有三个数字:摘要写 30 亿到 310 亿,正文先写 31 亿到 403 亿,后来又写 30 亿到 92 亿。没人说明哪套废弃了。

一句话:这套逻辑成立,但支撑它的数字不干净。


四、对普通人有什么关系

你可能会说,这跟我有什么关系。我讲三件实际的。

第一,找工作看方向,别只盯"芯片"三个字。

超节点这个逻辑跑通,钱会分到几个地方:交换芯片和交换托盘、液冷全柜部件、高功率电源。这几个环节的人才需求是从零开始的,很多是从传统行业转过来的人。液冷尤其——以前主要在服务器厂做,现在液冷母排、快接头、管路这些部件全要人,而且这是新工种,行业里没有存量人才池。

第二,看项目别只看"发布"。

两篇研报里最有分量的一个数据,是华为 CloudMatrix 384 商用落地 750 多套。而不是那些"发布""点亮""计划量产"的词。

发布是新闻,交付是事实。看任何科技项目的新闻,先找那个已经商用落地的数字,找不到就说明还在实验室阶段。

第三,也是最实用的——听到"必然""唯一"这种词,要多问一句"那谁在算账"。

中金这两篇研报水平不低,逻辑链条是完整的。但它有六条风险、三个没讨论的关键变量、五个自己没对上的数字。

这不是说它错了。是说任何一份研究报告,你都得自己算一遍那个乘法。

单价乘数量等不等于总额,两个口径打不打架。别人告诉你的结论可能是对的,但推导过程里可能藏着没说的假设。


最后留个问题。

按这两篇的算法,2027 年会有 2.38 万个超节点机柜,2256 个亿的市场。

那么问题来了——

这些柜子装上去之后,算力用得起来吗?

一边是三分之一的算力在闲置,一边是几千亿往里砸。

这两个数字同时成立,说明了什么?是需求还没被开发出来,还是建的速度超过了用的速度?

我也不知道答案。但我觉得,这可能是接下来一年这个行业最值得盯的一件事。

比任何一条政策、任何一份研报都值得盯。

相关学习资料