乐于分享
好东西不私藏

一文看懂 AI 工厂网络:InfiniBand、RoCE 与 Spectrum-X 为什么成为算力的一部分?

一文看懂 AI 工厂网络:InfiniBand、RoCE 与 Spectrum-X 为什么成为算力的一部分?

过去建设数据中心,网络通常被视为服务器之外的配套设施。只要端口够用、链路稳定,它往往不会成为整套系统最受关注的部分。

AI 工厂改变了这种关系。

当数千甚至数万颗 GPU 共同训练一个模型时,任务会被拆分到不同服务器和机柜。每完成一轮计算,GPU 之间都可能交换梯度、参数、激活值或专家路由数据。通信没有完成,下一轮计算就很难继续。

于是,一个问题被不断放大:

为什么采购了更多 GPU,训练速度却没有等比例提升?

原因之一就在网络。集群规模越大,一次拥塞、一次路径不均衡,甚至少量节点的延迟,都可能让大量 GPU 一起等待。

此时,网络开始影响 GPU 利用率、训练周期、推理吞吐和单位 Token 成本。这也是 InfiniBand、RoCE 和 Spectrum-X 受到越来越多关注的背景。

一、AI 工厂为什么比普通数据中心更依赖网络?

传统互联网业务的流量通常更加分散。少量请求晚到,并不会让整个系统停止运行。

分布式 AI 训练则具有很强的同步性。以数据并行为例,每张 GPU 先处理一部分训练数据,随后进行梯度同步。只有不同节点的数据交换基本完成,下一轮计算才能继续。

MoE 模型还会产生更加动态的通信。不同 Token 可能被路由到不同专家,节点之间的数据交换更复杂,流量热点也更难预测。

所以,AI 网络不能只看端口速率,还要看:

• 高负载时能够获得多少有效带宽;• 拥塞能否被及时发现和分流;• 多个任务并发时能否相互隔离;• 少量慢流量会不会拉高整体尾延迟。

AI 工厂需要的不是一张平均速度很快的网络,而是一张在大规模同步通信下依然稳定的网络。

二、InfiniBand 为什么长期占据高性能集群?

InfiniBand 不是在普通以太网上增加一个加速功能,而是一套面向高性能计算构建的网络体系。

它从传输、网卡、交换机到管理和软件能力,都围绕低延迟、高吞吐和大规模节点协同设计。借助 RDMA,数据可以减少 CPU 参与和多次内存复制,更直接地在不同节点之间传输。

InfiniBand 的优势也不只是“延迟低”。自适应路由、拥塞控制、服务质量和网内计算等能力,可以共同改善高负载下的通信效率。

对于同步训练而言,这种端到端协同非常重要。企业不仅希望平均性能高,也希望集群负载升高后,通信表现不要突然恶化。

它的局限同样明显。InfiniBand 拥有相对独立的设备、软件和运维体系,企业需要相应的技术能力。对于已经拥有庞大以太网基础设施的云厂商而言,全面切换另一套技术体系并不轻松。

因此,InfiniBand 的核心竞争力是高性能与确定性,而它长期面对的挑战,是如何与生态更广、供应选择更多的以太网竞争。

三、RoCE 如何把 RDMA 带到以太网?

RoCE 的全称是 RDMA over Converged Ethernet,也就是通过以太网实现 RDMA。

它提供了一条很有吸引力的路线:企业不必放弃熟悉的以太网生态,也能减少 CPU 参与和数据复制,提高服务器之间的通信效率。

这对云厂商尤其重要。它们已经拥有大量以太网交换设备、光模块、布线体系和运维团队。如果能够在这些基础设施上承载高性能 AI 集群,部署灵活性和供应链选择都会更大。

但“运行在以太网上”不代表普通数据中心网络直接连接 GPU 就够了。

AI 训练会产生大规模、突发式的同步流量。当多个节点同时把数据发送到少量目标时,交换机队列可能迅速堆积。一旦出现持续拥塞、丢包或路径利用不均衡,RDMA 性能就可能明显波动。

稳定的 RoCE 网络通常需要同时处理队列规划、ECN 拥塞标记、端侧拥塞控制、多路径负载均衡、缓存管理和网络遥测。

早期部署经常强调通过优先级流控构建无损网络。现在的发展方向,则更强调端到端拥塞控制和精细调度,尽量降低对复杂人工配置和全局暂停机制的依赖。

RoCE 的价值来自开放的以太网生态,它的难度也来自这种开放性。设备选择越多、网络承载的业务越复杂,端到端设计就越重要。

四、Spectrum-X 到底是什么?

Spectrum-X 经常与 InfiniBand、RoCE 放在一起讨论,但三者并不处于完全相同的层级。

InfiniBand 是一套专用网络体系;RoCE 是通过以太网实现 RDMA 的协议和技术路线;Spectrum-X 则是 NVIDIA 围绕 AI 工作负载构建的端到端以太网平台。

Spectrum-X 建立在标准以太网和 RoCE 基础上,其组成不只是交换机,还包括 SuperNIC、自适应路由、拥塞控制、遥测和软件能力。

它的目标不是发明第三种网络协议,而是改善以太网在 AI 负载下的有效带宽、性能隔离和稳定性。

传统负载均衡通常根据有限的数据流信息选择路径。当大量通信同时发生时,多条流量可能集中到同一条拥塞链路,而其他链路仍未被充分使用。

Spectrum-X 强调网卡和交换机协同,根据网络状态调整流量路径,并通过遥测和拥塞控制降低局部热点对整个作业的影响。

它背后的逻辑是:

AI 网络的问题已经不能只由交换机单独解决。

所以,Spectrum-X 不是一个新的网络协议,也不只是一款交换机,而是一套针对 AI 通信模式进行端到端优化的以太网平台。

五、三条路线真正竞争的是什么?

如果只比较 400G、800G 或更高速率,三条路线之间的差异很容易被低估。

因为它们真正竞争的,是不同的 AI 网络建设方式。

InfiniBand 强调专用体系和端到端确定性,适合希望快速建设高性能计算集群,并愿意采用相对完整技术栈的客户。

RoCE 强调标准以太网、开放设备生态和部署灵活性,能够更好地融入现有数据中心,但对网络规划、拥塞控制和运维能力要求更高。

Spectrum-X 本质上也是一条 RoCE 以太网路线。它的差异在于,通过 NVIDIA 的网卡、交换机和软件协同,为 AI 负载提供更完整的端到端优化。

这场竞争最终落到几个问题:

• 标称带宽能转化成多少有效带宽;• 集群扩大后,尾延迟是否稳定;• 多个训练和推理任务能否相互隔离;• 部署、调优和故障定位是否足够简单;• 企业是否愿意采用一家厂商的完整技术栈。

AI 工厂采购的不是一批端口,而是一套让 GPU 持续协同工作的通信系统。

六、为什么 AI 网络正在被重新定价?

过去采购网络设备,企业主要比较交换机价格、端口数量和链路成本。

但在 AI 工厂中,只比较网络设备本身的采购价格,已经无法反映它的系统价值。

如果一套大型 GPU 集群因为网络拥塞,长期有部分 GPU 处于等待状态,损失的不只是网络性能,而是已经购买的 GPU、电力、机房和运维资源。

训练时间延长,还可能推迟模型迭代和产品上线。在推理场景中,网络效率同样会影响并发能力、响应时间和单位 Token 成本。

因此,高性能网络的价值需要按照另一套逻辑衡量:

它能够保护多少 GPU 投资,又能把多少理论算力转化成有效算力?

这是一个产业分析,而不是某个厂商公布的统一定价公式。但其逻辑正在变得越来越清晰:GPU 资产规模越大,提高 GPU 利用率的网络、光互连、遥测和调度软件,系统价值就越高。

网络并不是突然变成了计算芯片,而是开始直接影响 AI 工厂能够交付多少有效计算。

七、以太网会取代 InfiniBand 吗?

InfiniBand、增强型 RoCE 和 Spectrum-X 可以进入不同场景,也允许部分重叠。中央设置“工作负载”“规模”“生态”“运维能力”四个选择因素,体现没有适用于所有客户的唯一答案。

很难用简单的“会”或“不会”回答这个问题。

在追求极致性能和确定性的训练集群中,InfiniBand 仍然拥有深厚积累。它的专用体系、RDMA、拥塞控制和 HPC 软件生态,不会因为以太网进步就迅速失去价值。

但以太网拥有更广泛的产业基础。云厂商、交换芯片企业、网卡厂商和系统厂商,都在推动以太网适应 AI 与 HPC 负载。

Spectrum-X 代表厂商端到端优化路线。Ultra Ethernet Consortium 则代表多厂商开放标准路线,其 1.0 规范已经覆盖网卡、交换机、光互连和软件栈等多个层面。

两者都说明,以太网正在从通用数据中心网络,向面向 AI 和 HPC 的高性能网络演进。

未来更可能出现的,不是一种网络完全消灭另一种网络,而是市场进一步分层:

• 极致性能集群继续采用 InfiniBand;• 超大规模云厂商加速建设增强型以太网;• 企业客户在性能、生态和运维复杂度之间寻找平衡。

最终选择哪条路线,要看工作负载、集群规模、既有基础设施和团队能力,而不能只看协议名称。

结语

AI 工厂把过去相对独立的服务器,变成了一台由成千上万颗 GPU 共同组成的超级计算机。

在这样的系统中,GPU 决定单点计算能力,网络决定这些 GPU 能否真正协同起来。网络跟不上,更多 GPU 不一定带来等比例的性能提升,反而可能带来更多拥塞和等待。

InfiniBand 的价值在于专用体系和性能确定性;RoCE 的价值在于把 RDMA 带入开放的以太网生态;Spectrum-X 的价值,则在于通过网卡、交换机和软件协同,让 RoCE 以太网更适合大规模 AI 负载。

所以,这场竞争的核心不是谁拥有更高的标称速率,而是谁能让更多昂贵的 GPU 时间转化为有效计算。

当网络开始影响 GPU 利用率、训练周期、推理吞吐和单位 Token 成本,它就不再只是连接算力的基础设施。

它已经成为决定有效算力的一部分。