夜雨聆风学习资料网

ARTICLE · 1143906

推理服务网关卸载到 DPU:Scale-In 层的实测与架构含义

推理服务网关卸载到 DPU:Scale-In 层的实测与架构含义
F5 BIG-IP Next for Kubernetes 运行于 NVIDIA BlueField-3 DPU——LLM 请求路由、token 治理与安全功能从主机核卸载至 Scale-In 层器件。实测来源:ServeTheHome 实验室探访、Tolly Group 独立基准。
核心结论:推理服务的七层网关功能——请求路由、token 治理、认证与安全——属于 Scale-In 层:主机与外部用户及服务之间南北向基础设施流量的承载与治理。将这组功能从主机 CPU 卸载到 DPU(Scale-In 层的承载器件)后,实测同等负载下主机核占用约为 12 核对 2 核,GPU 显存峰值负载下推理吞吐提升 3 倍。Scale-In 层的承载清单由此从存储卸载与安全策略,进一步扩展到 token 级的流量治理。

2026 年 10 月 1 日,ServeTheHome 发布了对 F5 加州实验室的实地探访:F5 的应用交付与安全软件栈 BIG-IP Next for Kubernetes 运行在 NVIDIA BlueField-3 DPU 上,承担 GPU 推理集群前置的请求路由、token 治理与四层至七层安全。用本系列的框架表述:这些功能属于 Scale-In 层——此前该层的承载清单是存储卸载与安全策略,本次实测新增了七层网关,而承载器件正是 DPU。同期公布的 Tolly Group 独立基准给出了主机核占用的量化对比。本文以这两个一手来源为基线,分析推理服务网关卸载到 DPU 的架构逻辑与量化收益。

一、事件:推理服务网关功能迁移至 Scale-In 层器件

F5 是应用交付控制器(ADC)领域的代表性厂商,其传统产品形态是机架内的专用硬件设备:负载均衡、SSL/TLS 终结、防火墙与流量管理运行在设备本体的专用软件栈上。BNK(BIG-IP Next for Kubernetes)是这一能力向云原生环境的迁移——以 Kubernetes 原生形态交付同样的七层功能。本次实验室展示的关键变化在于部署位置:BNK 不再运行在主机 CPU 或独立设备上,而是运行在 BlueField-3 DPU 内。

F5 的机房实景说明了三种形态的并存:传统硬件设备仍在近旁机架中;BNK 也可以部署在主机 CPU 上运行;但实验集群选择了 DPU 部署。三种形态承担同一组功能,差别在于资源归属——设备形态独立占用机架空间,主机形态消耗业务核,DPU 形态则把这组功能移入 Scale-In 层的承载位置:主机信任域之外、网络路径之上、具备独立算力的专用器件。这一选择对应一个架构判断:七层网关属于 Scale-In 层的基础设施职责,而 DPU 是 Scale-In 层的承载器件。

二、推理集群的网络密度:网关为何属于 Scale-In 层的独立负载

外界对 AI 集群的想象通常只有一张高速网络,实际拓扑远为复杂。该实验室的集群中并存多张网络:GPU 之间与 GPU 到存储的高速 fabric(单端口 400 Gb/s 乃至 800 Gb/s)、用户与应用的接入网络、节点与主机操作系统的控制面、交换机管理网,甚至冷却系统、PDU 监控与串口控制台服务器各有独立网络,DPU 自身还带有专属管理接口。每一个平面都需要被路由、被限流、被防护——这正是应用交付功能的用武之地。

LLM 推理使七层网关的负载模型发生了质变。传统 Web 业务的七层负载以请求数计量;推理业务的每个请求在服务端展开为长时连接与持续的 token 流,路由、限流、认证与加密终结的开销随用户数与 token 量增长,而不随 GPU 数量增长。这类负载全部落在南北向路径上——用户与外部服务进出集群的流量,正是 Scale-In 层的定义范围。它们需要一个不与 GPU 争抢主机核、又在网络路径上的承载位置,而 Scale-In 层的承载器件就是 DPU。

三、BNK 功能拆解:路由、token 治理与四至七层安全

BNK 部署在客户端与 GPU 基础设施之间——这正是 Scale-In 层的位置:所有进出推理集群的南北向流量在此终结协议、执行策略。其功能构成如下:

功能
说明
LLM 请求路由
面向推理服务的请求分发与会话保持,路由决策随用户数与 token 量扩展
token 治理
以 token 为单位的限流、配额与准入控制,是多租户推理运营的计量基础
认证与加密终结
身份认证与 TLS 终结在网关层完成,不再占用业务节点资源
四至七层安全
边缘防火墙、DDoS 缓解、授权执行与响应中的敏感数据防泄漏
可观测与审计
对外部服务出口流量的全程审计追踪

测试集群的构成同样值得记录:GPU 服务器为 Supermicro 平台、NVIDIA H100(Hopper)代 GPU,每台配置 2 颗 BlueField-3 DPU;两台 2U 管理服务器各配置 8 颗 DPU;流量由 Keysight IxNetwork 与 CyPerf 负载发生器生成,单台能力超过 1.6 Tb/s;辅助连接使用 ConnectX-7 四端口 50 GbE 网卡。这一配置说明七层网关卸载对 DPU 数量的需求可能超过「每服务器一颗」的直觉——管理面集群的 DPU 密度达到每 2U 八颗。

四、实测:主机核占用与吞吐的量化对比

量化数据来自两组来源,口径不同,需分别对待:

维度
主机 CPU 部署
BlueField-3 DPU 部署
部署位置
业务主机操作系统内,与推理负载共享资源池
主机信任域之外的独立器件,独立算力与内存
主机核占用
约 12 核(HAProxy,Tolly 同等负载)
约 2 核(Tolly 同等负载)
GPU 资源干扰
网关处理与业务负载争抢主机核与内存带宽
网关处理与业务负载物理隔离
部署前提
无专用硬件即可运行
要求节点配备 DPU 硬件

第一组是 Tolly Group 独立基准(报告编号 226104,2026 年 3 月):同等负载下,BNK 运行于 BlueField-3 约占用 2 个主机核,开源方案 HAProxy 运行于主机约占用 12 个核。单台服务器释放 10 个核看似有限,但其价值在规模上累加——跨越成百上千个推理节点时,释放的算力相当于可观的额外服务器容量。这一算术在当前周期格外有分量:服务器 CPU 供应在 2026 年至 2027 年持续紧张,释放的核是稀缺资源。

第二组是 F5 自行给出的基准口径:在 GPU 显存占用达到峰值的场景下,将路由功能卸载至 DPU 可使推理吞吐提升约 3 倍。其机理解释是直接的——显存峰值意味着 GPU 已无余量处理抖动,主机侧网关引入的任何调度延迟都被放大;卸载后网关处理与业务负载隔离,抖动来源消除。

12 核 → 2 核
同等负载下主机核占用:HAProxy(主机)对比 BNK(BlueField-3),Tolly 独立基准
3x
GPU 显存峰值负载下的推理吞吐提升,F5 披露口径
1.6 Tb/s
单台 Keysight 负载发生器的流量生成能力
五、MCP 流量:智能体攻击面向编排层延伸

本次展示中值得单独讨论的是对 MCP(Model Context Protocol)服务器流量的防护。智能体工作流的本质是自动化执行工具调用序列:模型在推理过程中频繁访问外部工具、检索与数据服务,这些访问以 MCP 协议在主机与外部服务之间高频往返。由此,AI 推理集群的攻击面不再止于 GPU 端点,而是延伸到连接它们的编排层。

BNK 对 MCP 流量执行四至七层防护,覆盖边缘防火墙、DDoS 缓解、授权执行、响应中敏感数据防泄漏,以及对外部服务出口流量的全程审计追踪。这组能力放在 Scale-In 层的网关(DPU 上的统一执行点)而非各业务节点内实现,有一个结构性理由:MCP 流量的策略一致性要求所有出口经过同一执行点——分布式地在每个节点内实现,策略漂移与审计断点几乎不可避免。

六、架构含义:推理网关成为 Scale-In 层的新增承载类别

把这一事件放回 Scale-In 层的框架中,其位置一目了然。此前本系列分析中,DPU 在 Scale-In 层的承载清单包括:协议终结点(NVMe-oF、对象、RDMA)、KV 上下文元数据管理、租户隔离与安全策略执行。本次展示新增了一类:七层推理网关——以 token 为单位的流量治理。

七层网关对承载位置的三个要求,恰好逐一对应 DPU 的结构特征:其一,功能需位于主机信任域之外——DPU 天然满足;其二,需要独立于业务负载的算力与内存——DPU 具备通用核与独立内存子系统;其三,必须在网络路径上以保障策略一致性——DPU 就在路径上。三种替代形态各缺一项:主机软件缺第一项,专用设备缺与集群的集成密度, SmartNIC 类方案缺第三项所需的完整软件栈。作为规模背景,NVIDIA 2026 财年数据中心网络业务收入为 314 亿美元,同比增长 142%——DPU 随加速器出货成为标配组件的趋势已由财务数据确认。

技术含义:七层网关的负载特征(随用户数与 token 量增长、不随 GPU 数量增长)决定了它无法通过「更大 GPU」或「更多带宽」消化,只能通过独立承载解决。DPU 承接这类功能后,其价值度量从「释放了多少核」扩展到「承载了多少 token 级治理」——后者直接对应推理服务的多租户运营能力。
七、国内视角:七层卸载与 token 治理的工程切入点

对国内智算基础设施而言,这一案例给出三个可操作的参照:

  • 七层卸载是门槛最低的基础设施卸载切入点。
    与存储卸载、一致性互联相比,七层网关不依赖最尖端的 SerDes 与内存带宽,主要门槛在软件栈成熟度——这恰是国内基础设施处理器厂商可以最快补齐的维度,且 Tolly 式的核占用对比提供了清晰的量化评价方法。
  • token 治理是新的调度与计量维度。
    以 token 为单位的限流、配额与审计,是多租户推理运营的原生需求,对应计费与配额体系。将这一能力置于器件层,运营平面与业务平面解耦,是推理平台架构的一个确定性方向。
  • 形态上跟随 Kubernetes 原生集成。
    BNK 以 Kubernetes 原生形态交付而非传统设备,网关能力随集群编排系统部署与升级。国内同类能力如果以设备形态交付,将在云原生环境遭遇集成摩擦;以 Operator 与自定义资源形态接入编排系统,是可与业务方直接对话的产品形态。

概言之:推理网关的器件化表明 Scale-In 层的承载清单仍在加长。从协议终结、上下文管理到 token 级流量治理,基础设施处理器的职责边界随推理业务形态持续扩展——评价一颗国产器件,也要随之增加一个维度:它能否在主机信任域之外,承载以 token 为单位的治理与安全。

说明:本文由智算互联研究团队基于 ServeTheHome《Touring the F5 BIG-IP Next for Kubernetes Lab》(Patrick Kennedy,2026.10.1,F5 赞助的实验室探访)、Tolly Group 独立基准报告 226104(2026.3)及 Tech Times、LavX 等公开报道整理分析。文中核占用数据来自 Tolly 同等负载对比,吞吐提升数据为 F5 披露口径(峰值显存负载场景),均未经本团队独立复测。
END
Some images are sourced from the internet. All rights belong to their respective owners. If there is any infringement, please contact us for removal.
往期回顾
以色列又出一个超强 DPU:28 亿美元公司估值
OpenAI 推理芯片Jalapeño 架构拆解
量子计算的互联问题:从实时纠错到 NVQLink
太空算力与智算互联:从星地通信进化到星间互联
2026年智算互联芯片公司融资盘点
DeepSeek 的「多层垂直优化」到底强在哪?智谱月之暗面和MiniMax该如何应对?
华为 NPO vs 英伟达 CPO:光互联的路线之争
多轨与多平面:智算网络中两个易混淆的概念
DGX Spark 堆叠扩展与存储扩展全解析
机器视觉进入 RDMA 时代-GigE Vision 3.0 标准8月发布
Hot Chips 重新定义 DPU:从卸载到拥有 AI 系统的数据路径并充当基础设施的信任根
DPU: Agentic AI原生 Scale-In Infrastructure Engine
Scale-In 把 DPU 推上节点内资源平面-AI 工厂的第五支柱
从云 DPU 到 AI DPU:BlueField-4 如何重写智算节点的基础设施平面
Hot Chips 2026 技术复盘:智算与互联的协同重构 AI 算力系统架构
以色列/美国Scale-Across 首次商用落地:两座数据中心连成一台 AI 超级计算机
UEC 与 MRC 交锋背后:AI 网络的多路径时代,网卡走向「算力引擎」
摩尔线程 P/D 分离白皮书:AI 网络正在从「搬运梯度」转向「搬运 KV」
SIGCOMM 2026 论文解读:面向 AI 云的解耦式 DPU 架构(DistDPU)
超节点「上云」:从自建机房到云上租赁的算力运营拐点
I 关于「智算X互联 AI-X OpenLab」
「智算X互联 AI-X OpenLab」是聚焦于智能计算(智算)基础设施互联技术与产业生态的垂直领域平台。我们深度追踪从芯片、服务器、超节点、网络(RDMA/IB/以太网)、DPU到集群软件栈等的全栈技术演进,解读国家算力政策与市场趋势,剖析头部企业战略与创新产品。我们致力于成为中国智算领域的“连接器”与“加速器”:
-为开发者:提供最前沿的技术解析、开源项目动态与实践指南。
-为企业管理者与投资者:提供深度的产业分析、竞争格局洞察与投资机会研判。
-为数据中心用户与供应商:搭建供需对接、方案选型与经验共享的桥梁。
我们的目标是构建一个中国智算领域专业社群,推动中国智算基础设施的高质量发展与自主创新。

相关学习资料