夜雨聆风学习资料网

ARTICLE · 1159540

AI推理光互连与池化内存 专题一:光互连能救内存墙吗?

AI推理光互连与池化内存 专题一:光互连能救内存墙吗?

2025 年 12 月 2 日, Marvell 宣布以约 32.5 亿美元收购 Celestial AI——10 亿美元现金加股票,另设最高 22.5 亿美元、与营收里程碑挂钩的或有对价。这家公司 Photonic Fabric 技术的首个应用不是芯片,而是"全光 scale-up 互连",官方路线图的后续应用里还有一项: pooled memory appliances (池化内存设备)。

几个月后, NVIDIA 也在自己的内存层级里加了一层: 2026 年 3 月公开的 CMX 平台引入了 G3.5——一个以太网连接的闪存层,专门放 KV cache ,位置在 GPU HBM ( G1 )和共享存储( G4 )之间。

两件事,两条路线,同一个问题:当 AI 推理撞上内存墙,答案会是光吗?

我的判断先放这儿:光互连加内存池化是可信方向,但它首先扩大的是内存的容量、距离和利用率;能不能降低逐 token 延迟( TPOT ),取决于每个计算端点实际拿到的有效带宽和热数据的访问方式。单有低延迟光器件,或者单有大内存池,都不足以证明 TPOT 会改善。

本专题系列是关于光互连在AI推理内存池化相关技术分析报告,这篇是总览。文中量化数字除标注来源外,均为情景推导,不是任何厂商的实测性能。

一、内存怎么成了新瓶颈

先看负载。

多轮 Agent 对话里,任务时间大致等于:各轮 TTFT 之和 + 各轮输出 token 数 × TPOT + 工具执行 + 调度等待。每一轮的 prefill 要吃掉完整上下文,每一轮的 decode 要反复读整份 KV cache 。

KV cache 的规模容易被直觉低估。以 Llama 3.1 70B 型结构( 80 层、 8 个 KV head 、每 head 128 维)为例, BF16 精度下每 token 的 KV 约 320 KiB ; 32K 上下文一个会话约 10 GiB ; 32 个并发会话就是约 320 GiB——已经超过多数单机的 HBM 总量。

但重复调用并不必然让 KV 按次数倍增。相同模型、相同前缀、相同 token 位置的状态可以共享: PagedAttention/vLLM 借鉴操作系统分页管理 KV ,做到近零碎片和跨请求共享,吞吐因此提升 2-4 倍。分支独有后缀、不同模型、变化的工具结果,仍需要独立状态。

这里有个关键区分:活跃 KV 和驻留 KV 。活跃 KV 是正在 decode 的会话每步要读的,它决定带宽需求;驻留 KV 是暂停会话、等工具的上下文,它只占容量。一个有一万个驻留会话、只有一百个在 decode 的系统,可以有非常大的内存池,而不需要让全部驻留数据每步过网络。

prefill 和 decode 的约束也不同。 DistServe ( OSDI 2024 )把两个阶段拆到不同 GPU 上,消除互相干扰,在 TTFT/TPOT 约束下能多服务 7.4 倍请求——但代价是 prefill 产生的 KV 必须跨阶段传输,数据搬运从配角变成了主角。

再看"墙"。一共四堵,光互连只解其中几堵:

容量墙——模型或 KV 装不下,被迫加卡、量化、驱逐或重算。光互连允许内存离开紧凑封装、跨节点共享。

带宽墙——每步读数据的时间超过计算时间。光互连扩大可到达的外部带宽,但不改变内存介质本身的带宽。

算力墙——需要的 FLOP 超过有效算力。光互连补不了数学计算,只能减少等待。

互连墙——模型分片、 KV 迁移或远端访问超过端点带宽和时延预算。这是光互连最直接的用武之地。

差距在快速拉大: SK hynix 的路线图综述引用了一组趋势数字——算力吞吐每两年增长约 3 倍,互连带宽同期只有约 1.4 倍。

二、一对数字讲透全部

还是那组容量: 32 并发 × 32K 上下文 ≈ 320 GiB 的 KV 。现在看两种用法。

用法一,每步扫描。高并发 decode 每生成一个 token ,都要把既有 KV 全部读一遍。如果这 320 GiB 每步都经过同一条 128 GB/s 的单向有效远端链路,仅数据搬运就约 2.68 秒每步——还没算权重和计算, TPOT 已经没得谈。

用法二,一次恢复。会话暂停后恢复、或在节点间迁移,把 10 GiB 上下文一次性搬过去:同样 128 GB/s ,约 84 ms 。报告用 2 秒作为"重做这段长上下文 prefill"的示例基线(明确标注是示例,不是实测), 84 ms 的传输显然划算得多。

同一个内存池,同一条链路:一种是 2.68 秒的灾难,一种是 84 ms 的节省。差别全在用法。

我的判断:这是光互连+内存池化最重要的一个结论。它的近期价值集中在用法二——温 KV 复用、减少重复 prefill 、会话迁移;最难啃的是用法一——把高并发 decode 每步都要扫的热 KV 放到远端。

这对数字怎么来的、 20 ms 的 TPOT 目标下 128 GB/s 到底还剩多少余量,专题二完整推导。

三、光互连能做什么,不能做什么

能做的,一句话:让内存走得更远、放得更多、用得更省。

容量可以离开 HBM 变成跨机架共享的资源;链路距离不再受铜的损耗约束;利用率可以从"每节点自购、峰值互不相让"变成"全池按需分配"。 SK hynix 在 Nature Electronics 上的长期方向正是如此:把光互连延伸到内存接口,让多个加速器共享一个大内存池。

不能做的,也一句话:光互连不产生算力,不凭空造带宽。

第一,传播本身有成本。光在光纤里单向约 5 ns/米: 10 米约 50 ns , 30 米约 150 ns ,请求响应往返再翻倍。如果一个产品同时宣称"30 米"和"低于 350 ns",该问的是:单向还是往返?缓存命中还是完整 load-to-use ?计不计介质读取?亚 10 ns 的芯片间目标,只能在短距离或排除传播时延的口径下讨论。光相对电信号的真正优势是长距离低损耗和高 I/O 密度,不是传播得更快。

第二,指标有口径。器件级的 80 fJ/bit ( Avicena 的 LED 发射端指标)、链路级的 4.6 pJ/bit ( Lightmatter 某测试系统 wall-plug )、系统级的焦耳每 token ,是三个不同层级的数字,不能互相替代。看到 pJ/bit 宣传,先问测量边界画在哪里。

第三,介质不会因为你前面接了光就变成 HBM 。光 fabric 的吞吐受"端点、交换、控制器、介质"中最短板限制,用高速光 I/O 接一段 DDR5 通道,它还是 DDR5 的带宽。

第四,池化也不自动省钱。一百个节点各配 1 TB 、忙闲错峰下平均只用 40 TB 时,共享池可以少买 40% 的内存;但如果所有节点峰值同步,这笔账要重算。池化的总成本还包括接口、交换、光源、冗余和管理。

四、产业的分化:各家做的不是同一件事

行业并没有整齐划一地"卷光内存池化"。拆开看,每家做的东西成熟度和形态都不一样。

NVIDIA :网络先行,上下文层跟进。 2025 年 GTC 公布的 Spectrum-X/Quantum-X 硅光交换机, 1.6 Tb/s 每端口,厂商口径 3.5 倍能效、 63 倍信号完整性、激光器数量减 4 倍,与 TSMC 、 Coherent 、 Corning 等联合开发。 2026 年 3 月的 CMX 补上 G3.5 闪存层,由 BlueField-4 驱动, Dynamo 和 NIXL 在 decode 前把 KV 块预置回 GPU 或主机内存,厂商口径最高 5 倍 TPS 、 5 倍能效——注意,这是相对传统存储的特定比较,不等于 TPOT 下降 80%。

Marvell/Celestial AI :押得最直接。收购之后,第一代 PF chiplet 公开 16 Tb/s 带宽(是 1.6T scale-out 端口容量的 10 倍),首个应用是光 scale-up 互连,后续是池化内存。他们 2026 年 7 月的论文给出了一个可核查的结构: 16×16 被动光纤 shuffle 连接 16 个主机,共享 32 TB CXL 内存,每主机 128 GB/s 单向;硬件仿真测得空闲读往返 283 ns ;服务仿真中 300 并发多轮对话的 TTFT 改善 6.6 倍。作者同时明确写了:物理设备的端到端推理验证仍待完成。收入预期是 FY2028 第四财季 5 亿美元年化、 FY2029 第四财季 10 亿美元——前瞻性指引,不是已实现收入。

SK hynix :唯一给出同行评审路线图的存储原厂。 Nature Electronics 综述提出每节点超 100 Tb/s 、低于 1 pJ/bit 、芯片间低于 10 ns 的下一代目标——再次强调,这是路线目标,不是已实现的全系统指标。

Samsung 和 Broadcom 各干各的: Samsung 有 CXL 电气池化的系统实测(专题四展开), Broadcom 可核实的重点是交换机 CPO 。把它们和"光内存池化"混在一句话里,是多数报道的不严谨之处。

一个值得记住的外部参照: LightCounting 2026 年 5 月的预测假设,到 2030-2031 年只有 10% 至 15% 的 scale-up 互连会迁移到 NPO/CPO ,机架内仍以铜为主,光用于跨机架。这是"逐步渗透"的基线;机架内光化和超大 scale-up 域,是它列出的上行情景。

五、边界与反方

下结论之前,把反方摆全。

第一,"AI 业务等于 Agent"是前提,不是事实。公开资料不足以断言整个 AI 业务当前已由 Agent 主导;训练、推荐、多模态批处理、普通对话仍是重要负载。即使是 Agent ,也分交互式(重响应时间)和后台式(重成本与吞吐)两类, TPOT 对二者的权重完全不同。

第二,厂商倍数必须放回基线里读。 6.6 倍 TTFT 是相对"容量耗尽后驱逐退化"基线的仿真改善,不是相同热容量下的 TPOT 改善 6.6 倍; 5 倍 TPS 是相对传统存储的特定比较。

第三,算法路线是变量。 GQA/MQA 、 MLA 、 KV 量化、稀疏和窗口 attention 、前缀共享、推测解码,都会直接改变 KV 容量、读带宽和每接受 token 的计算量。固定假设"模型和 KV 无限增长",会系统性高估硬件池化的窗口。

第四,行业缺统一口径的独立测试。端到端、长时间、多租户、第三方可复现的数据,目前是这个领域最稀缺的东西。同一厂商的披露再详细,也不是第三方验证。

我的判断是:未来更可能形成的是"本地 HBM + 光连接共享 DRAM/HBM + 共享闪存"的分层体系,而不是把 HBM 整体搬走。短期内,热数据留在 HBM ,温 KV 池负责复用与迁移,闪存层兜住更冷的上下文。

六、接下来看什么

四个观察点,比 Tb/s 峰值更接近业务结果:

每 XPU 有效读带宽——不是交换机总容量,不是端口双向标称,是每个端点实际拿到的单向有效带宽。

热 KV 远端比例——每步读取的 KV 里,真正走远端链路的占比。它直接决定 TPOT 会不会被拖累。

温 KV 命中率——池化收益的盈亏平衡取决于真实的前缀共享率和会话间隔, 100% 命中证明不了线上收益。

完整系统 J/token 与 P99.9——对应业务结果的最终指标,以及尾延迟。

再加一个工程视角:光互连的维修与量产良率。假设 10,000 条通道各自 99.99% 合格,全部通道同时合格只有约 37%——阵列化路线绕不开冗余、可修复映射和 known-good-die 这些题。

下一篇,专题二: KV 的算术。一个会话到底多少 GiB , 32 并发要多少带宽, 20 ms 的 TPOT 目标下 128 GB/s 还剩多少余量——全部可复算。

本文由 AI 辅助创作,作者进行了实测验证和编辑修改。

相关学习资料