8192张AI芯片。
256TB统一内存。
16.3PB/s互联带宽——是全球互联网峰值带宽的10倍。
昨天,在上海世博中心开幕的2026世界人工智能大会上,华为做了一件事:把他们最强的AI计算设备,第一次完整地展示在公众面前。
这台"怪兽"叫昇腾950超节点(Atlas 950 SuperPoD)。
一个核心问题:为什么不能简单"堆卡"?
先说一个反直觉的事实:AI芯片不是越多越好。
传统做法是把几百张GPU插到机架上,用网线连起来。听起来很简单,但问题来了——
芯片之间要互相"说话"。训练大模型时,数据需要在卡之间来回搬运。卡越多,"说话"越慢,等待时间越长。
业内有个残酷的规律:集群规模扩大10倍,有效算力可能只提升3-4倍。剩下的全浪费在"等待"上了。
这就是为什么英伟达现在主推的不是单卡,而是NVL72、NVL144这样的"超节点"产品——把几十张卡用高速线缆紧密连接,减少通信开销。
而华为这次展示的Atlas 950,直接把这个数字拉到了8192张。
灵衢协议:让8000张卡"像一台电脑一样工作"
这是华为破局的关键。
传统集群是"联邦制"——每张卡有自己的内存,需要通过网络访问其他卡的数据。而Atlas 950采用了一种叫**"灵衢"(UnifiedBus)**的自研互联协议,实现了三个核心突破:
第一,统一内存编址。
8192张卡的256TB内存,在逻辑上变成了一个连续的地址空间。任何一张卡都可以像访问本地内存一样,直接读写其他卡的数据。
用人话说:8000张卡,表现得像一台超级计算机。
第二,超大带宽。
卡与卡之间的互联带宽达到16.3PB/s。这是什么概念?英伟达NVL144的互联带宽是262TB/s,Atlas 950是它的62倍。
第三,超低时延。
单跳通信时延从传统的2微秒降到200纳秒,降了10倍。对大模型训练来说,这意味着更少的"等待"、更高的效率。

数据说话:和英伟达差多少?
直接上对比(数据来源:中银证券、华为官方):
| 指标 | 华为Atlas 950 | 英伟达NVL144 | 差距 |
|---|---|---|---|
| 卡规模 | 8192张 | 144张 | 56.8倍 |
| FP8总算力 | 8 EFLOPS | 1.2 EFLOPS | 6.7倍 |
| 内存容量 | 1152TB | 77TB | 15倍 |
| 互联带宽 | 16.3PB/s | 262TB/s | 62倍 |
这些数字意味着什么?
按华为披露的数据,相比上一代昇腾384超节点,Atlas 950的训练性能提升17倍,推理性能提升26.5倍。
路透社的报道更直接:这是目前全球算力规模最强的AI计算设备。
一个你可能没听过的概念:"心灵手巧"四层架构
华为的技术路线可以概括为**"心灵手巧"**——
"心"是昇腾NPU芯片。受限于制程,单卡性能确实在追赶。Atlas 950搭载的Ascend 950DT芯片采用双Die架构,配备144GB HBM内存,单卡互联带宽2TB/s。
"灵"是灵衢互联协议。这是华为真正的杀手锏,让成千上万张芯片能够高效协同,实现"群狼战术"。
"手"是CANN异构计算架构。相当于英伟达的CUDA,是连接AI框架和底层硬件的桥梁。华为已全面开源,累计代码超1244万行,月活开发者3500人。
"巧"是MindSpore AI框架。和PyTorch、TensorFlow兼容,让开发者能平滑迁移。
这套**"芯片+互联+软件+框架"**的全栈自研体系,是华为敢把超节点规模扩展到数千卡的底气。

跟你有什么关系?
如果你是AI开发者:
这意味着国产算力生态正在成熟。昇腾384超节点已商用750多套,覆盖互联网、金融、医疗、交通等20多个行业。而且是国内唯一训练出SOTA模型的超节点——DeepSeek V4、Kimi K3这些顶级模型,都跑在昇腾上。
CANN开源了,MindSpore兼容PyTorch,迁移成本在降低。
如果你是投资者:
AI算力的竞争维度正在变化。以前比的是"单卡性能",现在比的是"系统能力"。
华为在单芯片上受制程限制,但通过互联协议、集群架构、软件生态的系统性创新,正在弥补单点差距。这种"以面代点"的打法,可能是国产算力破局的核心逻辑。
如果你是普通人:
WAIC2026透露了一个数据:中国Token日均调用量已达数百万亿(2024年初还是1000亿)。你用的豆包、千问、Kimi,背后的算力正在快速国产化。
争议:这是"堆卡"的胜利吗?
有人质疑:昇腾单卡性能不如英伟达,靠堆更多的卡取胜,是不是"人海战术"?
这种理解有误区。
真正的技术壁垒不在芯片数量,而在"能不能堆起来"。
8000张卡协同工作,需要解决的问题包括:通信协议、内存一致性、故障隔离、散热供电、软件调度……任何一个环节出问题,整个集群都无法正常运行。
英伟达目前最大的NVL576预计2027年上市,卡规模依然远不及Atlas 950。这说明,把超节点做到这个规模,本身就是极高的技术门槛。
不过,华为的软肋依然存在:
- CUDA生态的护城河。全球数千万开发者、150万个基于CUDA的AI模型,迁移成本很高。
- 先进制程受限。Ascend 950DT的制程细节未公开,但普遍推测在7nm级别,和英伟达的4nm/5nm仍有差距。
- 海外市场不确定性。MWC2026已在海外展示Atlas 950,但实际出货能否突破制裁,还要观察。
这是一场系统对系统的较量,而不是单点对单点的比拼。
2026年Q4:50万卡超集群将上市
华为在WAIC上还透露:基于Atlas 950 SuperPoD,将在2026年第四季度推出Atlas 950 SuperCluster,算力规模超过50万卡。
而中科曙光也在同期发布了全国产十万卡AI超集群"曙光8000"。
中国AI算力,正在从"追赶单卡"转向"领跑集群"。
作者:Blake | 科技产业观察 | 2026年7月18日
参考来源:
- 华为官方新闻:《昇腾950超节点真机亮相2026世界人工智能大会》
- Reuters: "Huawei unveils China's most powerful AI chip cluster at WAIC 2026"
- 中银证券研报:《昇腾950超节点与英伟达NVL144对比分析》
- 21世纪经济报道:《WAIC上的算力重器:华为昇腾950超节点真机现身》
- 新华网:《超300款AI新品将在2026世界人工智能大会首发》
你觉得国产AI算力能在三年内追上英伟达吗?欢迎在评论区分享你的看法。
夜雨聆风