夜雨聆风学习资料网

ARTICLE · 1111267

AI 抢完内存、抢完电,下一站轮到"光"了

AI 抢完内存、抢完电,下一站轮到"光"了

过去一个多月里,有三件事连在一起发生,指向同一个方向。

8 月 14 日,英伟达官宣全面投产 Spectrum-X 以太网光子交换机——全球首款量产的 200G/lane CPO(共封装光学)以太网交换机。

8 月 12 日的财报电话会上,光通信大厂 Lumentum 把营收指引上调到 12.5 亿美元,同比增长 130%,其中约 2.5 亿美元是这次上调的增量,核心驱动是 1.6T 光模块和 OCS 光路交换。

而这两天,两家供应商先后上调了自己所在市场的"天花板":Coherent 把长期 OCS 市场规模预估从 20 亿美元直接翻倍到超过 40 亿美元,并说 40 亿仍可能偏保守;Lumentum 则把原先约 80 亿美元的估计,改口说"可能偏低"。

可插拔光模块

▲ 图片:Wikimedia Commons。传统可插拔光模块(SFP+)——CPO 要做掉的,就是它们

我写过"AI 抢内存",也写过"AI 抢电"。现在轮到第三样东西:光。

这篇文章想讲三件事:CPO 和 OCS 到底有什么区别(这两个词现在被混用得厉害)、为什么"光"一定会成为瓶颈(物理原因)、以及这条链上谁在什么位置(英伟达的分工表其实就是一份现成的产业链地图)。

先交代来源:英伟达 CPO 交换机的规格与供应链分工来自英伟达官方信息(IT之家报道);Lumentum 的指引与 OCS 数据来自其财报电话会,以及优分析(UAnalyze)整理的产业数据;市场规模预测来自 LightCounting、CignalAI 等机构。我没有实测过这些产品;属于我判断的部分,我会标出来。

现在很多文章把 CPO 和 OCS 混在一起讲,其实它们解决的是完全不同的问题。优分析给了一句我认为最好记的总结:

CPO 让光更靠近芯片,OCS 决定光要送去哪里。

CPO 与 OCS 的区别

▲ 两个技术的分工。制图:AI前哨-X,数据来源:IT之家、优分析(UAnalyze)

先说 CPO。

传统网络的做法是:把独立光模块插在交换机面板上,光模块先把电信号转成光信号,经光纤传输后再转回电信号。问题在于,每一次转换都带来功耗、热量和潜在的故障点。

CPO 的做法是把光学引擎和交换芯片封装在同一个模块里,让光信号的生成与转换紧贴着负责转发的交换 ASIC,从而缩短电信号必须走的距离。

英伟达 Spectrum-X 的核心是一块多芯片模块,内部并行集成数百个硅光子引擎。更妙的一步是:它把激光器从每个收发器里拿出来,改成由外置激光源统一供光——所需激光器数量只需原来方案的约 1/4。

结果是一组非常硬的数据:相比传统可插拔光模块方案,功耗降到 1/5,AI 应用无中断运行时间延长 5 倍,平均事件间隔时间提高 10 倍。

硬件规格上,小的 SN6810 在 2U 液冷机箱里配 128 个 800Gb/s 端口、总交换能力 102.4 Tb/s;大的 SN6800 在 5U 系统里堆 4 颗 ASIC,交换能力 409.6 Tb/s,支持 512 个 800Gb/s 端口,或超过 2,000 个 200Gb/s 端口。

再说 OCS。

OCS 是"光路交换机"。传统交换机收到光信号后,要先转成电信号做交换,再转回光信号发出去;OCS 则直接改变光的传输路径,省掉中间的光电转换,因而降低功耗与信号损耗。

它现在的放量速度是这样的:出货量在一个季度内翻倍,单季营收首次突破 1 亿美元,公司预计下一季 OCS 营收继续超过 1 亿美元,2026 年下半年营收目标超过 4 亿美元。

一个更值得注意的细节是:OCS 的应用位置,正在从大型 AI 集群往机柜内部下沉。Lumentum 除了开发不同端口数的 OCS,还开始投入 in-tray 产品,部分客户甚至在研究"每个机柜配一台 OCS"——当某个 GPU 故障或负载过高时,用 OCS 重新安排光路,把数据绕到其他可用的算力上。

二、为什么"光"一定会成为瓶颈

这不是一家公司的选择,而是物理规律逼出来的。

为什么光会成为瓶颈

▲ 三个物理原因。制图:AI前哨-X(作者解释)

第一,集群规模在指数级增长。从千卡到十万卡,网络端口数量的增长,比芯片数量的增长更快——因为每一块新加的芯片,都要和集群里其他芯片建立连接。

第二,铜的可靠传输距离,随速率提升而缩短。速率越高,铜缆能可靠传输的距离越短。当机柜间、机柜内的连接速率一代代翻倍,铜能覆盖的范围就一代代缩小。

第三,可插拔光模块把损耗留在了面板上。电转光、再光转电,每一次转换都是功耗和故障点。

所以每一次速率翻倍,网络都会被迫往"光"再靠近芯片一步。这也解释了为什么 CPO 不是"可选项"——它是被逼出来的必选项。

顺带说一个能说明紧张程度的细节:据报道,鸿海的全光 CPO 交换机柜"一机不剩",全部出货给英伟达,连展示机柜都被拉走了。英伟达还与康宁宣布在美国建三座新工厂,专注研发 CPO 技术。

交换机与配线架

▲ 图片:Wikimedia Commons。机架式以太网交换机与配线架

三、英伟达那张"分工表",就是一份产业链地图

这是我认为这条新闻里最实用的一部分。

英伟达公开了 CPO 交换机的制造分工:

英伟达 CPO 交换机的分工

▲ CPO 交换机的供应链分工。制图:AI前哨-X,数据来源:IT之家援引英伟达官方信息

台积电负责硅光子技术;SPIL(矽品)负责芯片级封装与测试;Lumentum 与 TFC 供应激光器组件;富士康负责整机交换机系统开发;英伟达在自有设施完成出货前的最终测试。

为什么我觉得这张表比一份研报更有用?

因为它是甲方公开写出来的分工。谁在这个系统里承担哪一段、谁的名字被点到,是被英伟达自己确认过的。你要判断一家公司有没有坐在 AI 光网络的牌桌上,看它有没有出现在这张表里,比看它自己的宣传材料可靠得多。

而且这张表还告诉你一个关键事实:CPO 的产业链,是把半导体制造(台积电)、封装测试(SPIL)、光器件(Lumentum、TFC)、系统组装(富士康)串起来的一条跨行业链条。

它不是一个"光通信"行业的机会,它是四个行业的机会。

四、放量有多快:四个可以直接看的数字

光通信这个行业的麻烦在于,它的专业名词太多,很难判断"到底跑起来了没有"。所以我挑了四个最直观的数字:

放量的四个数字

▲ 四个可以量化跟踪的数字。制图:AI前哨-X,数据来源:Lumentum 财报电话会、优分析(UAnalyze)、CignalAI

第一,Lumentum 营收指引 12.5 亿美元,同比 +130%。这是一家光器件公司的整体盘子,一次指引上调约 2.5 亿美元。而且它说,1.6T 云端收发器已进入量产,预计从 2027 年第一季度起产量大幅提升。

第二,OCS 单季营收指引超 1 亿美元,出货量一个季度翻倍。

第三,Coherent 把自己对 OCS 市场的长期预估从 20 亿翻倍到超 40 亿美元——注意,是供应商自己上调自己的天花板。这在产业里是一个相当少见的信号:通常意味着需求已经跑到了他们的产能前面。

第四,CignalAI 预测 OCS 市场规模从 2025 年的逾 4 亿美元,增长到 2029 年的逾 25 亿美元;LightCounting 则预测全球 OCS 出货量到 2029 年突破 5 万台,2025 到 2030 年出货量年复合增长约 15%。

光纤连接器

▲ 图片:Wikimedia Commons。光纤跳线与连接器

把这四个数字放在一起,你会得到一句判断:光互连不是一个"未来的故事",它已经在收入表里了。

五、最值得盯的一个变量:OCS 往机柜里下沉

下面这部分是我的判断,我标清楚。

前面提到,OCS 正在从大型集群往机柜内部延伸,有客户在研究"每个机柜配一台 OCS"。我认为这件事如果成立,它的意义比"OCS 卖得好"要大得多。

原因是需求函数的性质会变:

如果 OCS 是部署在数据中心层级,那么它的需求大致跟着数据中心的建设数量走——增长是线性的、可预测的。

但如果 OCS 下沉到机柜层级,那么它的需求就直接跟着GPU/TPU 的部署数量走。而截至现在,OCS 与算力芯片的配比,行业里粗略按约 1.5:1 的 XPU 配置比例来估算。

从"跟着盖楼走"变成"跟着芯片走",这是量级上的变化。Lumentum 自己也提到,这类新应用最快可能在 2028 年底至 2029 年初带来增量需求。

所以我会建议你这样跟踪这条线:不要只盯光模块的出货量,盯 OCS 的部署位置。位置每下沉一层,需求的天花板就抬高一截。

六、跟你有关系的三个判断

三个判断

▲ 三个判断。制图:AI前哨-X(作者判断)

第一,看代际:光模块从 800G 到 1.6T 再到 3.2T,每一次换挡都会重排一遍供应链。

Lumentum 这次指引上调的核心驱动就是 1.6T 进入量产。这个行业的特点是:每一代速率的切换,都会让原有的供应商格局重洗一次——因为工艺、良率、封装方式都要跟着变。对关注机会的人来说,代际切换的时点,比行业增速更重要。

第二,看供应商的动作,比看研报更早。

这是一个我现在用得很多的观察方法:谁在扩产、谁在委外、谁在主动上调自己的市场天花板。Coherent 把 20 亿翻倍到 40 亿还说保守,Lumentum 开始增加内部产能并准备导入委外制造——供应商的资本动作,往往比分析师的预测早一到两个季度。

第三,看岗位:这条链上缺的是"跨界的人"。

硅光子设计、光引擎封装与测试、激光器、光模块工艺、数据中心光网络运维——注意这些岗位的共同点:它们都要求你同时懂一点电、懂一点光、懂一点封装。而这类"跨界"人才,恰好是过去几十年里教育体系最少培养的一类。

如果你在考虑往 AI 基建转,光互连可能是门槛相对清晰的一条路——它不像芯片设计那样需要极深的积累,但它确实需要你把两个原本分开的学科连起来。

七、哪些话不能说太满

第一,这篇文章讲的核心事实,部分发生在 8 月,不是今天。英伟达 CPO 全面投产是 8 月 14 日官宣,Lumentum 的指引是 8 月 12 日电话会。我把它和这两天的新增信息(外资与券商密集上调预期、供应商上调市场天花板)放在一起讲,是因为它们构成同一条趋势线,而不是要把它说成今日突发。

第二,"功耗降到 1/5""无中断时间延长 5 倍"是英伟达自己的对比数据,对比对象是采用传统可插拔光模块的网络,属于厂商在特定条件下的结论。

第三,CPO 不会立刻取代可插拔光模块。两者会在相当长时间里并存。可插拔光模块的生态成熟、可维护性好,CPO 的优势在超高密度场景,各有适用边界。

第四,市场规模的预测分歧很大。Coherent 说 40 亿美元仍可能保守,CignalAI 给的是 2029 年 25 亿美元,Lumentum 早年按 80 亿美元估。口径差异说明了这个市场的边界还没定型。

第五,"1.5:1 的 XPU 配置比例"是公司用来粗估的经验值,实际比例依网络架构而变,不要当成精确公式。

第六,本文不构成任何投资建议。

八、今天可以做的一件事

打开你收藏夹里任意一家"AI 硬件公司"的资料,做两个动作:

第一,看它在这条链的哪一层:光芯片、光器件(激光器)、光模块、CPO 封装、OCS、光纤与连接器、石英振荡器——七个位置,它站在哪一个?

第二,看它供货给谁。如果它的名字出现在英伟达、或某家云厂商公开的分工表里,那它是"A 级证据";如果只是自己在官网写"AI 概念",那还只是"C 级证据"。

这个动作做上十家公司,你对 AI 光网络的认知会超过 90% 的讨论者。因为大部分讨论停留在"AI 需要更多光模块"这个层面,而真正有用的是知道谁在哪一层、被谁点名。

回到开头

我写过 AI 抢内存:三星高层证实 2027 年 HBM 会吃掉近 30% 的 DRAM 晶圆产能。

我写过 AI 抢电:英伟达的 AI 工厂白名单,第一批只认证了储能和液冷。

这一次是光:英伟达把光引擎搬进了交换机,Lumentum 的出货一个季度翻倍。

这三件事连起来看,是一条很清晰的规律:AI 的瓶颈会一个接一个地出现,而每一次瓶颈出现的地方,都会长出一批新的公司、新的订单、新的岗位。

内存、电力、光——下一个会是什么?我猜,大概率还是那些"看起来很老、很不 AI"的东西。

最后想问一句:你所在的行业,有没有哪个环节最近突然变得"很紧"?是交期变长、还是报价变硬?在留言里说说,我会挑几个典型的,下一篇继续拆——AI 的瓶颈,还会出现在哪些你想不到的地方

相关学习资料