ARTICLE · 1105105
拆开国产AI机柜:华为、阿里自己做什么?芯片公司们做什么?


【内容目录】
一、一台AI机柜里,到底有几类芯片?
二、华为、阿里自己做了哪几块?
三、国产芯片公司,分别走到哪一步?
四、HBM:这一格难在哪?
五、结语:谁做什么?下一步看什么?
参考资料
9月,华为和阿里先后发布了新一代AI超节点。所谓超节点,就是把成百上千颗AI芯片连成一台“大机器”。两家的新机器里,自己研发的芯片都不少。
所以,一台国产AI机柜里,到底装着哪些芯片?哪些是华为、阿里自己做的,哪些要靠国内芯片公司,它们又做到了哪一步?
结论是:
华为、阿里自己做的,是最关键的几类,AI芯片、把AI芯片连在一起的互联芯片和协议、CPU;阿里还自研了网卡和硬盘主控,计划明年上市。
内存、硬盘、电源这些位置,国内芯片公司都已经拿出了产品,有的已经大批量出货,有的还在给客户送样。
有一个位置至今看不清,HBM,华为说自己研发了两种,但没说由谁生产;阿里没说从哪来。
1. 一台AI机柜里,到底有几类芯片?
先澄清一点:超节点不等于一个机柜。华为Atlas 950超节点满配是128个计算柜加32个互联柜;发布会上的卡数,有的指单机,有的指整个超节点。
按图1的示意,一个机柜像一栋楼:
顶层:交换托盘,负责联网;
中层:计算托盘,芯片最密集;
底层:电源框,把交流变直流。
计算托盘上有两套内存:AI芯片封装里的HBM,和CPU用的DDR内存条;此外还有SSD、网卡,以及AI芯片周围一圈供电芯片。下面按这些位置,一格一格看。

图1:机柜分成几种托盘(功能位置示意)
2. 华为、阿里自己做了哪几块?
先说三样两家都是自己研发的:AI芯片、互联、CPU。
AI芯片,华为是昇腾,阿里是真武。华为汪涛9月17日说,截至目前,“昇腾910C超节点已部署超1000套,昇腾950超节点也已规模商用”,下一代960DT、960PR分别在2027年一季度、三季度就绪。阿里的真武M890已经在灵骏超节点上对外提供云服务,新发布的真武V900计划2027年一季度量产并商用。
互联层面,华为用灵衢、阿里用ICN;CPU层面,华为是鲲鹏、阿里是倚天。这里的互联,指的是让成百上千颗AI芯片像一台机器那样协同工作的那套“内部高速路”:一套通信规则(协议),加上按规则转发数据的交换芯片。

图2:华为和阿里公开披露的AI芯片与HBM

图3:华为和阿里公开披露的CPU与SSD主控
两家不一样的地方,在互联往外延伸的那几块:
交换芯片:阿里单独发布了ICN Switch,1.0版已经在现网的灵骏超节点里用上;华为没有单独公布交换芯片的型号。
网卡和硬盘主控:阿里自研了磐脉网卡和镇岳硬盘主控,随新一代磐久超节点服务器上市,计划2027年一季度;华为这次没有单独公布。
光互连:超节点里跨机柜的连线,要靠光来传。华为自己做光引擎部件,称Hi-ONE是“业界首个量产的NPO产品”,960超节点用5,500个,替代原本需要的4.8万颗800G光模块;阿里用的是ODCC、阿里云、百度、腾讯等八家联合发起的SNPO方案。
华为那几格写着“未见单独披露”,不等于没有。汪涛说,除了昇腾芯片,华为还“基于灵衢UnifiedBus打造了系列化套片,全面覆盖计算、互联、存储、管理等关键能力”,只是没有逐一公布型号。

图4:华为和阿里公开披露的卡间互联与交换芯片

图5:华为和阿里公开披露的光互连与网卡
为什么偏偏是AI芯片、互联和CPU自己做,阿里还加上了交换芯片?这几样有一个共同点:它们都绑在同一套互联协议上。
协议,相当于这些芯片之间对话的语言和交通规则。灵衢、ICN都是华为、阿里自己定的规则:AI芯片要按它收发数据,交换芯片要按它转发,CPU想直接接进来,也得会这门“语言”。阿里就计划让之后的倚天750支持ICN;华为则说,自己那一整套芯片都是“基于灵衢”打造的。规则是自己定的,和规则绑得最紧的几颗芯片自己做,协同起来最顺手。
当然,这只是一条线索,不是定律。协议是自己的,芯片也可以和伙伴一起做,具体要看各家的产品披露。反例也有:镇岳这颗硬盘主控,走的是NVMe这种行业通用标准,国内也有大普微、联芸在做,阿里照样自研。为什么,阿里没有说,不能从一次发布倒推。
另一头,供电芯片、CPU用的DDR内存颗粒、内存接口芯片,两家这次都没有单独披露自研。这只说明公开信息的范围,不说明两家用的是谁的芯片。这些位置遵循行业标准,或者按各自的电源架构设计,不绑在某一家的专有协议上,国内都有专业芯片公司在做。这就是下一部分要看的。
3. 国产芯片公司,分别走到哪一步?
华为、阿里自己做的那几块之外,机柜里还有大量位置要靠专业芯片公司:内存条、硬盘、电源,还有各种接口和交换芯片。它们走到了哪一步?
最靠得住的,是公司自己在财报里怎么写。这些用词分量差得很远:“送样”只是样品到了客户手里,“测试”是客户还在验证,“量产”“批量出货”才是真正卖出去了。下面都照公司原话。
把十几家公司的原话放在一起看,能看出一条清楚的线:每个位置上,国产公司都已经有在卖的产品;卡在送样、测试阶段的,大多是专为新一代AI机器做的那一批。
先说明一点:列出一家公司,只说明它在这个位置有产品和公开进展,不代表华为或阿里用了它的芯片。下面回到计算托盘(图6),从内存条看起。

图6:拉出一层计算托盘(功能位置示意)
内存条上,国产走到了哪一步?
一根服务器内存条,除了一排DRAM颗粒,还有两颗关键的小芯片。
RCD负责“传话”:把内存控制器发来的地址和命令整理好,再转给颗粒,内存速率每上一档,它就得换一代。
SPD是内存条的“身份证”,存着这根内存条的配置参数。
澜起科技在这一格有一段少见的经历:它发明的DDR4全缓冲“1+9”架构,被JEDEC国际标准采纳,到DDR5演化成“1+10”,仍是国际标准。现在它的RCD已经做到第五子代,半年报说第五子代“开始规模出货”,第三、第四子代合计出货占比已经超过一半,一代一代跟着内存升级往前推。
聚辰股份做SPD,和澜起是搭档:它的DDR5 SPD是和澜起合作开发的,2021年四季度起就在主要内存模组厂商中大范围应用。今年二季度,随着部分下游需求回暖,以及SOCAMM2、LPCAMM2等新型内存模组陆续商用,它的DDR5 SPD出货量比一季度快速增长。
长鑫科技做的是颗粒本身。按出货量和销售额统计,它已经是中国第一、全球第四的DRAM厂商。但它最新的一步,也正好说明“量产”和“卖出去”是两回事:9月21日,长鑫公告第五代工艺技术平台“正式实现量产”,同一份公告写着,相关产品“尚未形成规模销售”。

图7:国产芯片公司在内存接口与DRAM颗粒上的公开进展
硬盘的“大脑”——主控,谁在做?
硬盘这一格最有意思:系统厂商和专业芯片公司在这里正面相遇。企业级固态硬盘好不好用,很大程度上看主控,它决定数据怎么写进闪存、怎么读出来,再加上固件,决定了速度和稳定性。阿里自己做了镇岳,国内的专业公司也在做。
大普微走的是全栈路线:主控芯片、固件算法、整块硬盘都自己做,已经批量出货,122TB的大容量QLC硬盘也已商用。有意思的是,它的原材料里还列着“主控芯片(外购部分)”:自己有主控,也照样买别人的。
联芸科技以主控芯片为主业。它的企业级SATA主控已经在出货;更高端的企业级PCIe 5.0主控,还处在“量产测试阶段,在头部客户处测试顺利”,还没到批量出货。
长江存储是闪存颗粒这一格的国内代表。它还没有上市,招股书(申报稿)引用TrendForce的数据称,2026年一季度它的NAND按销售额和出货量都是全球第三、中国第一。

图8:国产芯片公司在SSD主控与NAND颗粒上的公开进展
电是怎么一路降压,送到芯片嘴边的?
供电这一格,最能看出前面那条线。
AI芯片的核心电压很低,电流却很大:假设一路核心供电承担400瓦、输出0.8伏,电流就是500安培(原理算例,不对应具体产品)。电流越大,线上的损耗越大,所以电要分几段降:先在电源框里把交流变成直流,送进托盘后再做一次转换,最后一段贴着芯片,由多相控制器指挥一排功率级(DrMOS)把电压降到芯片需要的水平(图9)。

图9:供电路径示例(交流输入方案,省略滤波电容等器件)
电源框这一段,比的是功率器件。成熟产品都在批量卖,专为AI新做的还在送样。
士兰微的第二代碳化硅MOSFET已经通过国内顶级大厂的认证,在AI算力中心的电源上大批量出货。
东微半导的超级结和中低压MOSFET,在服务器电源、通信电源和基站电源领域批量出货。
英诺赛科(港股)走的是氮化镓路线。上半年,它面向AI及数据中心领域的芯片出货量同比增长183%,已在全球超过20家头部云服务商导入超过100项产品。
华润微则是另一种情况:它专门为AI算力电源定制开发的集成式碳化硅MOS,还处在“通过评估并送样”的阶段。

图10:国产芯片公司在电源框功率器件上的公开进展
到了芯片旁边,门槛明显变高:电流大、负载变化快,新产品要跟着AI芯片的平台一起验证。这里新老产品的差别最明显。
杰华特就是一个例子。它的90A DrMOS,2025年年报就说已“在行业头部客户侧量产”;今年新推出的16相数字控制器等新品,半年报写的是“已送样多个计算行业头部客户”。老产品量产了,新一代还在送样。
芯朋微的说法最积极:多相VRM、DrMOS、eFuse、PoL等产品已“全面进入量产”,覆盖服务器电源从一次到三次的整套方案。
士兰微把两件事写在了一句话里:服务器用的DrMOS、eFuse和多相控制器电路,“都已在客户端测试或已导入量产”。哪一款到了哪一步,没有拆开说。
英诺赛科把氮化镓也推到了芯片旁边:用于GPU供电的DrGaN产品,“完成头部客户送样测试”。
思瑞浦做的是电源监测。它的电流和功率监控芯片用于AI服务器、交换机的电源轨监控,半年报说服务器相关市场的销售比去年同期增长较快。

图11:国产芯片公司在托盘供电电路上的公开进展
接口、交换和CPU,这几格谁在做?
最后看连接部分。这里有三种容易混的芯片:Retimer把高速信号重新整形,让它传得更远;PCIe交换芯片把一路连接分给多块设备;以太网交换芯片连接的是服务器和服务器之间的网络。
澜起科技在这里又出现了。它的PCIe Retimer上半年出货量显著增长;按半年报引用的弗若斯特沙利文数据,2024年这个市场前两家合计占96.9%,澜起以10.9%排第二。下一步的PCIe交换芯片还在研发,“预计年内完成工程样片流片”。还是那条线:成熟产品在放量,新一代还在路上。
盛科通信做的是另一种交换芯片,这里要澄清一个常见误区:同样叫交换芯片,干的活并不一样。前面说的ICN Switch、华为互联柜里的交换,连的是超节点内部的AI芯片;盛科的以太网交换芯片,连的是服务器和服务器,链路和协议都不一样,不能因为名字相同就当成一回事。盛科交换容量12.8Tbps和25.6Tbps的旗舰芯片,半年报说已“在客户处进入应用阶段”。
海光信息在CPU这一格。华为有鲲鹏、阿里有倚天,独立的国产服务器CPU供应商里,海光的CPU兼容x86,已经广泛应用于电信、金融、互联网等行业。

图12:国产芯片公司在PCIe中继与交换、以太网交换和服务器CPU上的公开进展
4. HBM:这一格难在哪?
回到开头那个看不清的位置:HBM。
AI芯片算得再快,数据喂不进来也是白搭。HBM就是贴着AI芯片放、专门给它“喂数据”的内存。华为在2025年全联接大会上说,自研了两种HBM:HiBL 1.0配昇腾950PR,HiZQ 2.0配950DT,后者容量144GB、带宽4TB/s。
HBM本质上也是DRAM,但和内存条上的DRAM不是一回事。做出能用的HBM,要过三关。
先是叠。HBM不是一颗芯片,而是把好几层DRAM芯片垂直叠成一叠:按JEDEC的HBM4标准,一叠最多16层,容量最高64GB。层与层之间,靠贯穿硅片的细孔(硅通孔)上下连通。每一层都要磨得很薄,再层层对准叠好;叠好之后,只要其中一层有问题,整叠都可能报废。层数越多,这一关越难过。
然后是连。按JEDEC标准,HBM4一个堆叠的接口宽2048位,带宽最高2TB/s。两千多路信号同时跑,相当于在封装里修了一条两千多车道的专用路。这么密的线,普通电路板走不下,要在封装内部解决:图13的方案,就是把HBM和计算芯片一起放在一块中介层上。这一步靠的是先进封装。

图13:AI芯片封装及周边供电(以采用HBM与中介层的封装为例,省略散热结构)
最后是配。HBM和AI芯片封在一起之后,其中一叠HBM出问题,整颗AI芯片都可能跟着报废。所以HBM要跟着具体的AI芯片、具体的封装方案一起验证,不是单独做出来就能用。
说到底,HBM考的不是某一项本事:DRAM芯片要会做,先进封装要跟得上,还要和AI芯片一起磨合,缺一样都不行。
5. 结语:谁做什么?下一步看什么?
拆完这一台机柜,谁做什么,已经比较清楚了。
华为、阿里自己做的,是整台机器最核心的几块,AI芯片、互联和CPU。
内存条、硬盘、电源、接口这些位置,国内芯片公司都已经拿出了产品,成熟产品在批量出货,专为新一代AI机器做的,还在送样和测试。
下一步要看的,是这批新产品什么时候走到批量出货;还有HBM这一格,什么时候能看得更清楚。
参考资料:(上下滑动可查看):