ARTICLE · 1031905
华为昇腾960:当AI芯片开始“站在光里”,中国算力正在从造芯片走向造系统


原创画面,概念演绎非实物
--- 记录AI如何在我们眼前,一点一点成为这个时代 ---
竺火今日AI观察:AI算力竞争,正在从一颗芯片变成一整套系统
这次昇腾960发布真正值得记录的,也许不是“中国又有了一颗更快的AI芯片”。
而是中国AI算力竞争的重心,正在从“能不能造出芯片”,转向“能不能把芯片、光、网络、存储和软件组织成一台巨大的计算机”。
当AI芯片开始“站在光里”,竞争的单位也变了:从一颗芯片,变成一个系统。
我们每天看到AI,只需要一个屏幕。问一句话。等几秒钟。答案就出来了。一切显得越来越轻。但有一个有点反常识的事实正在发生:AI越聪明,托住它的物理世界反而越来越重——更多芯片、更多存储、更多电力、更多冷却、更复杂的数据中心以及越来越快的芯片之间的连接。
9月17日,在上海举行的华为全联接大会2026上,华为公布了下一代昇腾960路线,以及Atlas 960E超节点、Peerium计算架构等一系列AI基础设施方案。如果只看发布会,很容易把注意力放到那些巨大的数字上:4096颗NPU、8 EFLOPS FP8峰值算力、1 PB HBM、51.2万颗乃至百万级处理器连接能力。
但我认为,这场发布会真正值得《AI in the Making》留下来的,并不是“华为又发布了一颗更强的芯片”。而是另外一件事情:AI算力竞争的基本单位,正在变。
过去我们习惯比较一颗芯片。未来越来越需要比较的,可能是一整台机器、一整座集群,以及计算、存储、连接和软件能不能共同工作。而且这一次,还有一个很有象征意味的变化:光,开始被搬到芯片身边。

原创画面,概念演绎非实物
01|先别急着问昇腾960到底有多快
先把最容易兴奋的部分放稳一点。
华为公布,昇腾960的开发进度好于原计划,而性能则是“按计划翻倍”。其中,昇腾960DT计划在2027年第一季度可用,比原路线图提前三个季度;960PR计划在2027年第三季度就绪,提前一个季度。华为同时表示,此后继续维持一年一代的迭代节奏,2028年、2029年分别推进970和980。
注意两个区别。提前的是研发进度,性能翻倍,是华为原计划中的目标。另外,这是2027年的产品路线图,不是今天已经大规模交付的数据中心。
路透社也报道,华为目前的AI计算设备需求仍然超过供给能力,公司尚无法满足全部国内需求。
这反而说明为什么今天不能只看一颗芯片的参数。因为AI发展到现在,问题已经不是:“我有没有一颗足够强的芯片?”而越来越变成:“我能不能把足够多的芯片真正组织起来?”
02|为什么芯片开始要“站在光里”
想象一下。一个人计算得非常快。没有用。如果十万人一起工作,却把大部分时间花在互相递纸条,他们组成的公司依然不会高效。
AI集群也一样。当模型训练从几百张卡扩展到几万、几十万张卡以后,芯片彼此交换数据本身就成为巨大负担。算力越来越强,连接反而开始成为瓶颈。
所以这一代AI基础设施里,“互联”正在从配角走向舞台中央。
华为这次发布的一个重要变化,就是把NPO——Near-Packaged Optics,近封装光学引入Atlas 960E超节点。简单说,就是让负责传输数据的光学器件离芯片和封装更近。
过去,大量数据需要先通过更长的电连接,再进入可插拔光模块。速度越来越高以后,电传输距离越长,功耗、信号损耗和系统复杂度都会增加。于是,人们开始想:能不能让“光”早点接手?这就是NPO背后的基本逻辑。
“近封装”并不意味着把所有光学器件都直接做进芯片封装里,它和CPO也不是完全相同的概念。但方向非常清楚:光正在一步一步向计算芯片靠近。
华为称,其Hi-ONE光互联引擎单个传输能力达到7.2 Tbit/s,并称这是首款达到量产准备状态、同时内置光源的NPO产品。基于昇腾960和Hi-ONE构建的Atlas 960E,单个超节点最多可以连接4096颗NPU,提供8 EFLOPS的FP8峰值计算能力和最高1 PB的HBM容量。
这里的8 EFLOPS,是理论峰值。不是训练一个真实模型时一定能够获得的速度。

原创画面,概念演绎非实物
03|5500个光引擎,为什么值得注意
华为还给出了一个很醒目的比较。按照它公布的Atlas 960E设计,使用约5500个Hi-ONE光引擎,可以避免采用其比较方案中约4.8万个800G传统光模块,并称能够降低超过550千瓦的功耗,同时提升系统无故障运行时间。
这个数字当然很容易让光通信产业的人紧张。是不是以后光模块都不要了?并不能这么理解。这是华为针对特定系统架构给出的设计比较,不是所有数据中心、更不是整个光通信行业的统一结果。
但它确实暴露出一个非常重要的产业变化:随着AI集群越来越大,“光放在哪里”本身正在成为系统设计的一部分。
过去,我们讨论光通信,更多关注:数据中心之间怎么连接、机柜之间怎么连接、现在问题正在向内部继续推进:光能不能更靠近交换和计算?
这也是为什么NPO、CPO这些过去相当工程化的缩写,突然成为AI产业的重要词汇。因为AI正在逼着整个计算系统重新设计自己的血管。芯片负责计算,HBM负责把数据及时送给它,光开始负责让成千上万颗芯片彼此说话。

原创画面,概念演绎非实物
04|下一步:让一百万颗处理器,像一台电脑
这次发布会另一个值得留下来的东西,是Peerium计算架构。它想解决的其实还是同一个问题:芯片越来越多以后,怎么让它们不只是“很多芯片”,而像“一台更大的计算机”?
华为给Peerium提出了几个核心机制:嵌套式并行、统一内存寻址、处理器之间的对等互联。底层依托UnifiedBus,把CPU、NPU、内存、SSD、网卡和交换设备连接起来。
如果把这些专业名词翻成人话,大致可以理解为:过去,我们努力让一颗芯片内部的计算单元更好地协作。现在,人们开始试图把几十万甚至百万颗处理器组织成一台逻辑上的巨大计算机。
华为称,两层四平面的Clos网络可以连接最多51.2万颗NPU,再结合multi-rail拓扑,架构上可扩展至百万颗NPU。
但这里同样必须把边界说清楚:“支持百万颗处理器”不等于“百万卡集群已经建成”。华为自己的Peerium公告明确写着,目前正在部署的是25.6万卡规模的Atlas 950 SuperCluster,而基于NPO的Atlas 960系统仍处于测试阶段。
这个区别很重要。因为《AI in the Making》记录的不是愿景有多漂亮。而是:愿景走到了哪一步。

原创画面,概念演绎非实物
05|为什么说AI竞争已经从“芯片”变成“系统”
把这几个东西放到一起看,逻辑就清楚了。昇腾960负责计算,HBM提供高速存储,Hi-ONE和UnifiedBus解决互联,Peerium试图解决越来越庞大的处理器怎样协同,OceanStor M900把KV Cache这样的推理数据进一步拉进整个系统设计,CANN则负责最容易被普通人忽略的另一半:软件。
华为表示,CANN已经进入持续的社区化开源开发,昇腾目前支持90多个第三方开源项目,包括PyTorch、Triton、vLLM、veRL等,并已经成为PyTorch官方支持的加速器后端之一。
为什么软件这么重要?因为你可以买一座非常昂贵的机房,但如果模型难迁移、工具不好用、工程师不熟悉,再漂亮的硬件参数也可能停留在PPT里。
这也是英伟达真正强大的地方之一。它建立的并不只是一颗GPU,而是一整套由芯片、互联、服务器、网络和CUDA软件生态组成的计算体系。路透社在报道华为这次发布时,也特别指出:华为正在强化对英伟达的挑战,但英伟达仍然拥有CUDA软件生态上的领先优势。
所以华为这一次真正值得观察的,不是:昇腾960单卡能不能超过谁。而是:华为能不能建立另外一套完整、持续进化、真正有人使用的AI计算系统。这是难得多的问题。

06|从世界看,这可能才是AI基础设施真正的下半场
过去几年,我们讨论中美AI竞争,常常容易把问题简化成:美国有英伟达。中国有没有一颗可以替代英伟达的芯片?
但AI产业越往前走,这个问题越显得不够完整。因为所谓“英伟达”,早已经不是一颗芯片。而所谓“国产算力”,未来也不可能只靠一颗芯片完成。
AI基础设施正在越来越像一座城市。芯片是工厂、HBM是仓库、光互联是高速公路、交换设备是立交桥、软件是交通规则、最后还需要电力、散热和工程师,让整座城市真正运行起来。缺任何一环,都可能堵住。
这也是我认为华为昇腾960这次发布最值得记录的地方。它并没有证明中国已经解决了AI算力问题,产能还要验证,可靠性还要验证,软件迁移成本还要验证,真正的大规模运行效率,也要等客户和时间来回答。
竺火今日批注|中国AI算力的技术路线,正在从“追一颗芯片”,转向“建一套系统”
人工智能给人一种奇怪的错觉,它看起来越来越不像工业。没有烟囱、没有流水线、没有巨大的机械轰鸣。我们看到的,只是一块屏幕、一句问题、一个答案。于是很容易以为,这场革命正在离物理世界越来越远。
可事实可能刚好相反。为了让屏幕里的那个答案快一点,人类正在建造越来越庞大的机器。芯片越来越多、存储越来越大、电越来越多、散热越来越复杂。当电已经来不及搬运越来越庞大的数据时,人类甚至开始把光搬到芯片旁边。
智能看起来越来越轻,托住智能的世界,却越来越重。
所以昇腾960真正值得记录的,也许不是某一个参数超过了谁。而是它让我们看到:AI计算正在发生一次尺度变化。从一颗芯片,走向一台机器。从一台机器,走向一座集群。从计算本身,走向计算、存储、连接和软件组成的完整系统。
过去,人们努力让一颗芯片变得越来越强。今天,人们已经开始思考:怎样让一百万颗处理器,像一台电脑一样工作。
这是一个很大的转折。因为到了那个时候,决定AI能力上限的,就不只是芯片上有多少晶体管。还有芯片之间能不能看见彼此、交换数据、共享记忆、协调行动。而“光”,正在成为其中越来越重要的语言。

多年以后回头看,我们也许不会记得昇腾960今天公布的每一个数字。但我们可能会记得这样一个时刻:当AI开始需要百万级处理器协同时,光第一次如此明确地走到了芯片身边。
它提醒我们——AI的未来当然写在模型里,也写在硅里,写在电里,写在存储里,也开始越来越多地,写在光里。
-- AI人工智能时代并不是突然到来的,它就发生在今天以及我们正在经历的每一天 --