ARTICLE · 1155352
【国产AI】把算力卡熔成一台机器,还是买一柜子单卡?国产算力选型账|10-11
万卡集群的算力利用率常常掉到两成,剩下八成算力在干一件事——等卡与卡之间把数据传完。解决这个"等"字,正是国产算力最近一年从比拼单芯片跑分,转向系统级创新的原因。当你要决定"怎么买国产算力"时,第一个分岔就是:上超节点,还是上单卡。
一、超节点:把几千张卡"焊"成一台机器
事件概述 超节点(supernode)是把多台计算节点用高速互联紧密连起来、共享统一内存、像一台计算机协同工作的系统。华为九月十七日在全联接大会 2026 上发布的昇腾 960 超节点,是业界首个采用 NPO(近封装光学)技术的超节点:单节点可扩展到 4096 卡,提供 8 EFLOPS FP8(16 E FP4)算力、1PB HBM 容量。
值得关注的原因 它用 5500 个自研 Hi-ONE NPO 光引擎(单引擎 7.2T,行业最大、唯一内置光源),替代原本需要的 4.8 万颗 800G 光模块,功耗直接降 550 千瓦以上,系统无故障时间翻倍、可用度 99.8%。马尔科夫实验室仿真显示,由 4K 超节点组成的 10 万卡集群,相比 8 卡服务器堆出来的同规模集群,模型算力利用率(MFU)能从约 20% 提升到 2.75 倍。昇腾 910C 超节点已部署超 1000 套,950 已规模商用,2028、2029 还将推 970、980。
二、单卡阵营:四小龙资本市场会师
事件概述 九月十一日,燧原科技在科创板挂牌,发行价 142.18 元、开盘冲到 410 元(盘中最高 475 元,涨幅超 200%,中一签最多赚 16.64 万元)。它的登场,让摩尔线程、沐曦、壁仞、燧原这"国产 GPU 四小龙"在资本市场正式聚齐。
值得关注的原因 四家都已从"产品验证"跨进"规模交付":摩尔线程(2025 年 12 月科创板)2026 上半年营收 17.36 亿元、同比增 147%;沐曦(同月科创板)上半年营收 13.24 亿元,归母净利润 6.12 亿元、率先账面盈利;壁仞(2026 年 1 月港交所)上半年营收 12.36 亿元、同比暴增 1997.6%、毛利 42.7%;燧原拟募 60 亿元,腾讯既是第一大股东也是第一大客户(2025 年占其营收 83.79%)。
三、超节点 vs 单卡:一张选型对照表
事件概述 落到采购决策,两种形态不是谁取代谁,而是各管一段。一张可收藏的对照:
| 维度 | 超节点(昇腾 960) | 单卡 / 单机(四小龙) |
|---|---|---|
| 最佳场景 | 十万亿参数训练、超大集群推理 | 中小模型推理、垂直部署、性价比甜点 |
| 扩展性 | 统一内存地址,近线性扩展 | 需自建集群,通信开销随规模上升 |
| 软件生态 | 灵衢 + CANN,原生训练栈 | CUDA 兼容 / 自研栈,迁移成本不一 |
| 成本结构 | 整柜投入大,但每训练 token 成本低 | 单卡便宜,但大模型要更多卡补齐 |
| 国产化 | 全栈国产、关键场景只供国内 | 各家进度不一,部分仍处爬坡 |
值得关注的原因 关键在"显存看总参数不是激活参数":像 600B 的 MoE,即使只激活一小部分,也得把全部参数装进显存。所以超大模型天然绑定超节点或大集群;而几十 B 以内的稠密模型,单卡甜点区的性价比反而更高。
四、选型四问:先问自己再掏钱
事件概述 把选型拆成四个问题:
① 训多大的模型——十万亿级闭眼选超节点,几十 B 推理单卡更香;
② 训练还是推理——训练吃互联带宽,推理下沉单卡更省;
③ 预算与交付期——超节点整柜投入与交付周期长,单卡可小步快跑;
④ 国产替代优先级——政务、关键行业优先全栈国产,通用业务可混搭。
值得关注的原因 现实里多是混合架构:训练放超节点抢时间,推理层用单卡铺量降边际成本。别被"单卡跑分更高"带偏——万卡集群里真正贵的不是卡,是卡间互相等待浪费的那八成算力。
五、格局数字:替代正在加速
事件概述 IDC 数据,2025 年英伟达在中国 AI 加速卡市场份额已降到 55%(出货约 220 万张),华为以 20.4% 居国产厂商之首,平头哥 6.4%、寒武纪 3.0%、昆仑芯 2.8%、海光 1.9%、沐曦 1.7%、天数智芯 1.5%、摩尔线程 1.3%,国产合计约 41%。2026 年中国 AI 服务器本土厂商份额已达 41%。
值得关注的原因 市场本身在爆发:国产通用 GPU 市场 2022 年仅 10 亿元,机构预测 2029 年将达 2221 亿元,2025—2029 年复合增速 91.4%。但收入变大、利润与现金流之间仍有温差——燧原招股书里腾讯占营收八成以上的依赖度,提醒我们"能不能稳定交付、生态能不能低成本迁移"才是下半场。
结尾观点
买算力不再只是挑一颗跑分最高的芯片。超节点解决的是"大"的问题——把万卡熔成一台机器,让十万亿参数模型训得动;单卡解决的是"广"的问题——把推理铺到千行百业、把成本压到甜点区。2026 年的国产算力,胜负手已经挪到了芯片、互联、存储、整机协同的那张系统总分上。
算力的竞争,早就不是单颗芯片的跑分,而是"芯片-互联-存储-整机"的系统总分。
数读:英伟达在中国 AI 加速卡市场份额,从几年前接近垄断,到 2025 年 IDC 口径已降至 55%。
今日互动
如果你的团队要上国产算力,你更倾向① 直接上超节点一步到位,还是② 先单卡小步铺开?报 1 或 2。 想看我深挖哪一块?① 昇腾 CANN 生态迁移实操 ② 四小龙哪家先盈利的账 ③ 超节点运维坑。留言点单。 回复『清单』领今日算力选型四问表;回复公司名投你关心的国产芯片线索。
明日预告:明天回到每日 AI 资讯速览;下个周末我们算「四小龙哪家先盈利」的细账。
信息来源为公开报道,仅供参考。