01
引言
现代人工智慧训练面临一个基本挑战:训练过程的不同阶段需要不同的网络架构。模型并行(model parallelism),包括专家并行(EP)和张量并行(TP),需要在数百个节点之间进行高频宽的全对全(All-to-All)通讯,这类网络称为扩充网络(scale-up networks)。同时,资料并行(DP)需要在超过10,000个xPU之间建立连接,使用环形全归约(Ring-AllReduce)通讯,这类网络称为横向扩展网络(scale-out networks)。传统的电封包交换机在摩尔定律逐渐接近极限的情况下,难以满足这些不断增长的需求,在处理能力和能耗方面都出现瓶颈。
日本产业技术综合研究所(AIST)的研究人员提出一个创新解决方案:光学交替切换架构,根据AI训练工作流程中固有的特定通讯模式动态重新配置网络拓扑[1]。

02
利用AI训练的特性
这个架构的关键洞察来自对AI训练实际运作方式的理解。训练过程包含三个不同步骤:输入资料的前向传递处理、使用误差反向传播法计算参数梯度的反向传递,以及使用资料并行结果的参数更新。全对全通讯和环形全归约通讯总是交替出现,而且参数只需要在专家并行中执行相同角色的xPU之间共享。

图1:AI训练过程,显示前向传递、反向传递和参数更新三个阶段及各自的通讯模式。

图2:提出的光学交替切换架构,使用1x2光学交换机阵列在EP/TP的全网状ODC网络和DP的Rail ODC网络之间动态切换,最大化光收发器使用率。
03
架构设计
该系统在每个xPU的光收发器内安装1x2光学交换机阵列。这些交换机在用于前向和反向传递的全网状光学直连(ODC)网络与用于参数更新的Rail ODC网络之间交替切换。在全网状配置中,每行的xPU连接到不同的全网状ODC网络。在Rail配置中,每列的xPU连接到不同的Rail ODC网络。这种设计在最大化光收发器利用率的同时,每个训练步骤只需要进行两次光学切换,消除电封包处理的瓶颈,并减少昂贵的光收发器需求。
架构的有效性取决于透过光学传输控制器(OTC)实现的新型通讯协定。OTC由序列器(sequencer)、控制暂存器(control registers)、直接存储器存取控制器(DMAC)、流量控制器(flow controller)和接收缓冲区组成。对于硅基光电子交换机,系统采用马赫-曾德干涉仪(Mach-Zehnder interferometer)交换机搭配涡轮脉冲技术(turbo-pulse technology),在微秒级时间内完成切换。

图3:光学传输控制器(OTC)和硅基光电子交换机阵列,展示包括序列器、DMAC、流量控制器以及硅基光电子MZI交换机阵列直接控制界面的架构。
04
实验验证
研究团队使用Altera FPGA作为xPU建构评估系统,在Stratix10 SX和Agilex AGFB014板卡上实现OTC。每个节点配备100G QSFP28 ER4光收发器,连接到AIST开发的8x8 O波段光学交换机。光学交换机透过暂存器改写直接从FPGA控制,实现高速运作。

图4:评估系统,展示FPGA板卡、OTC实现、涡轮脉冲控制以及硅基光电子8x8光学交换机配置。
效能量测聚焦于两个关键时间参数:从暂存器改写到接收端侦测到光讯号的时间(TD1),以及光路建立后的资料传输时间(TD2)。结果显示,两个方向的切换时间都稳定低于3.1微秒,确认直接FPGA控制成功利用硅基光电子的快速响应特性。

图5:多次验证中的TD1量测结果,显示A2到B1和B1到A2的切换都在3.1微秒内完成。
资料传输量测显示,小资料量的传输开销时间低于2微秒,这是透过高速序列器控制和直接DMAC协调达成,不需要事先进行元件配置。对于较大的资料量,系统达到QSFP模块100 Gbps的完整频宽使用率,确认到目的xPU存储器的高效单向通讯。

图6:PCS层链路建立后的单向资料传输效能,(a)显示资料传输时间与资料大小的关系,小资料量传输展现低于2微秒的开销,(b)显示不同连接路径的频宽使用率,大资料量时达到100 Gbps。
05
详细技术实现
OTC的运作机制展现高度整合的控制逻辑。当序列器从主机接收传输指令后,会根据指令改变暂存器设定值并切换光学交换机。在光路(PCS层链路)建立后,序列器向DMAC发出每个xPU所需的资料传输命令。DMAC执行与自身xPU相关的指令开始读取资料,在资料开头加入给目的DMAC的命令,然后传递给光收发器。在目的xPU端,光收发器接收的讯号透过接收缓冲区直接馈入自身的DMAC。在这个过程中,流量控制器在监控接收缓冲区可用容量的同时维持无损通讯。目的DMAC根据接收到的第一个指令执行写入存储器的操作。
这种架构采用状态无关(state-less)的单向通讯程序,不需要事先建立链路和感知配置变更,特别适合具有高度稳定光链路的ODC网络。OTC利用光学交替切换作为xPU之间的屏障同步(barrier synchronization)来启动资料传输,实现低开销的资料传输。
量测方法采用OTC内部的时间量测计数器。在TD2的量测中,引入1毫秒的等待时间以确保PCS层链路建立,然后在OTC上启动资料传输。在实际系统中,使用突发式光收发器(Burst optical transceivers)可以消除这1毫秒的等待时间,实现更快的链路建立。
量测结果显示,从FPGA A-2切换到FPGA B-1以及从FPGA B-1切换到FPGA A-2都在3.1微秒内完成。这证明从FPGA直接控制光学交换机能够充分利用硅基光电子的微秒级响应时间。对于不同资料大小的TD2量测,小资料量在1.61微秒内完成侦测,确认开销时间低于2微秒。这是透过序列器对相关元件的高速控制,以及与连接的DMA直接协调达成,消除事先元件配置的需求。对于大资料量,确认完全利用QSFP模块的100 Gbps频宽。
06
技术优势分析
相较于传统电封包交换架构,这个光学交替切换系统展现多项优势。首先,直接光连接消除封包处理的瓶颈,减少昂贵且耗能的光收发器数量。其次,透过在不同训练阶段共享光收发器,系统充分利用硬件资源。第三,硅基光电子MZI交换机搭配涡轮脉冲技术提供快速切换能力,使网络重新配置的时间开销降至最低。
系统的可扩展性也值得注意。架构允许轻松扩展具有更多埠口的光学交换机,因此可以支援更高的并行度。这对于未来更大规模的AI训练工作负载特别重要。
07
结论
这个光学交替切换架构成功展示,利用AI训练的确定性通讯模式可以显著改善网络效率。低于3.1微秒的切换时间和低于2微秒的传输开销,为可扩展的AI训练基础设施奠定基础,克服电交换的限制,同时降低功耗和成本。下一步将是使用这个架构展示AI训练效率的实际提升。
参考来源
[1] K. Mizutani, R. Iwami, T. Usuki, K. Ishii, R. Matsumoto, T. Inoue, K. Suzuki, K. Ikeda, and S. Namiki, "High-speed optical alternate switching between the networks for expert/tensor and data parallelism," in Proc. Opt. Fiber Commun. Conf. (OFC), Los Angeles, CA, USA, 2026, paper M4F.4.
END
NOTICE
点击左下角"阅读原文"马上申请
欢迎转载
转载请注明出处,请勿修改内容和删除作者信息!

关注我们
![]() | ![]() | ![]() |
关于我们:
深圳逍遥科技有限公司(Latitude Design Automation Inc.)是一家专注于半导体芯片设计自动化(EDA)的高科技软件公司。我们自主开发特色工艺芯片设计和仿真软件,提供成熟的设计解决方案如PIC Studio、MEMS Studio和Meta Studio,分别针对光电芯片、微机电系统、超透镜的设计与仿真。我们提供特色工艺的半导体芯片集成电路版图、IP和PDK工程服务,广泛服务于光通讯、光计算、光量子通信和微纳光子器件领域的头部客户。逍遥科技与国内外晶圆代工厂及硅光/MEMS中试线合作,推动特色工艺半导体产业链发展,致力于为客户提供前沿技术与服务。
http://www.latitudeda.com/
(点击上方名片关注我们,发现更多精彩内容)
夜雨聆风

