乐于分享
好东西不私藏

一文讲清楚DPU硬件卸载技术

一文讲清楚DPU硬件卸载技术

把 DPU 这件事说清楚

Nitro、CIPU、BlueField——网卡是怎么接管 Hypervisor 的

1买一台 64 vCPU 的云服务器,你从来拿不到完整的 64 vCPU 算力。网络虚拟化、存储虚拟化、安全组,全都跑在宿主机 CPU 上,这是云厂商交了多年的隐形税。

2AWS 的裸金属实例可以和 VM 一样用 VPC、EBS、安全组,还能分钟级交付——Hypervisor 去哪了?

3NVIDIA 一个卖 GPU 的,为什么花 69 亿美元收购 Mellanox,又把一张"网卡"抬到和 CPU、GPU 并列的第三颗芯片?

三个问题的答案是同一件事:硬件卸载。把网络、存储、安全的虚拟化从宿主机 CPU 搬到网卡上,算力全部留给租户。这张网卡各家叫法不同——AWS 叫 Nitro,阿里叫 CIPU,微软叫 Azure Boost DPU,谷歌叫 IPU,NVIDIA 叫 DPU,这个词就是它带火的。

这篇文章完整过一遍:先看开销在哪,再掰开名词,解剖五家的产品,然后讲卸载的机制,算一笔账,最后说它在 AI 时代的新角色。

一、虚拟化的隐形税

一台传统云宿主机的 CPU,除了跑租户的业务,还在替这些东西干活:

  • vSwitch 转发和 VXLAN/Geneve 封解装;
  • 安全组和 conntrack 连接跟踪;
  • virtio 后端的设备模拟和中断处理;
  • 存储加密、压缩;
  • 遥测、监控 agent。

网络密集型租户一来,软件转发路径能吃掉宿主机十几个百分点的 CPU,高 PPS 场景烧掉的比例更高。这些算力既没卖给租户,也没产生收入,纯交税。

一台网络密集型宿主机的 CPU 时间去哪了(示意)租户业务 ≈70%网络虚拟化≈14%存储虚拟化 ≈9%管理和监控 ≈7%比例为示意,随负载变化;网络/存储密集场景,虚拟化管理部分更高

图:卖出去的算力之外,宿主机还有一笔隐形开销

企业自建机房可以用 SR-IOV 直通这类办法对付,云厂商不行,有两个约束:

  • 多租户不可信。
    控制面不能放在租户内核里。SR-IOV 直通虽快,但 VF 数量有上限,策略下发、安全边界都不受控;
  • 弹性能力。
    热迁移、弹性网卡、安全组秒级生效,都要求一个集中的、租户看不见的控制面。

所以云厂商的优化路径是一步步走过来的,每一代都有取舍。

虚拟化优化的五个阶段(柱高示意 CPU 开销)开销最大明显降低接近线速独占核≈0全虚拟化QEMU 设备模拟灵活,开销最大virtio前后端驱动模型仍在宿主机 CPUSR-IOV 直通快,但控制面失控热迁移难、VF 有限DPDK 用户态转发核被独占PPS 上去,核没了网卡硬件卸载数据面进硅片CPU 几乎零开销

图:五代优化路径,开销和灵活性反复拉扯

virtio 把设备模拟变成前后端驱动,开销降了,但转发还在宿主机 CPU 上。SR-IOV 直接把 VF 透传给租户,接近线速,代价是控制面失控:VF 数量封顶、热迁移要拔 VF、安全策略没处放。DPDK + OVS-DPDK 把转发搬到用户态,PPS 大涨,但一个转发核就是独占一个核,还是烧 CPU。

走到尽头只剩一个选项:数据面离开 CPU,进硅片。DPU 不是硬件厂商造出来的新品类,是这条路径的必然产物。

二、SmartNIC、DPU、IPU、SuperNIC

这四个词市面上混着用,一次性掰开。

名词
谁在用
是什么
代表产品
SmartNIC
硬件形态的泛称
带可编程逻辑的网卡,重点是网络卸载
Broadcom Stingray、Xilinx Alveo SN1000
DPU
NVIDIA 带火,行业通用
SmartNIC + 通用 CPU 核 + 独立 OS,处理基础设施数据
BlueField、AMD Salina
IPU
Google、Intel 的叫法
Infrastructure Processing Unit,和 DPU 是同一类东西
Mount Evans(E2000)、E2200
CIPU
阿里云的叫法
Cloud Infrastructure Processing Unit,神龙的硬件部分
CIPU 2.0
SuperNIC
NVIDIA 在 AI 场景提的概念
面向 GPU 间通信深度优化,不做完整基础设施卸载
BlueField-3 SuperNIC

一个容易混的点:DPU 的 "D"(Data)处理的是基础设施数据面,不是业务数据。它不加速你的 MySQL,它加速的是"让你的 MySQL 跑在一台干净的宿主机上"这件事。

硬件上,这张卡有三条路线。

智能网卡的三条硬件路线可重编程的逻辑阵列ArmArmArmArm加速器独立 Linux固定流水线,按级处理FPGA灵活可重编程,功耗单价高Intel N3000/N6000、早期 Azure多核 SoC卡上跑完整 Linux,控制面空间大NVIDIA BlueField 全系固定流水线 ASIC性能功耗最优,改功能要改芯片AWS Nitro、阿里 CIPU

图:三条路线的取舍是灵活性、控制面空间和性能功耗的三角

FPGA 路线灵活,早期试水最方便,但功耗和单价高。多核 SoC 卡上能跑完整 Linux,控制面发挥空间大,BlueField 全系走这条。ASIC 性能功耗最优,Nitro、CIPU 都是,功能的灵活性靠片内可编程流水线补。选哪条,取决于迭代速度和用量。

三、五家的产品

按"谁先把模式跑通"排序,每家抓最有信息量的点。

AWS Nitro

Nitro 是把这套模式跑通的第一家。2013 年内部立项,2015 年收购 Annapurna Labs(媒体报道价约 3.5 亿美元),2017 年 C5 实例首次商用,如今几乎所有 EC2 实例都跑在 Nitro 上。

AWS Nitro System:薄 Hypervisor + 全卸载宿主机服务器租户 VM A租户 VM B宿主机没有 SSH没有运维登录口攻击面最小化Nitro Hypervisor:只管 CPU 和内存,没有设备模拟Nitro 网络卡VPC / SRDNitro 存储卡EBS安全管理卡监控 / 启动Nitro 安全芯片硬件信任根数据面(网络/存储/安全)全在卡上,Hypervisor 无设备模型可言

图:Nitro 三件套——Nitro Cards、Nitro Hypervisor、Nitro 安全芯片

Nitro 是三件套:

  • Nitro Cards
    :网络卡(VPC)、存储卡(EBS)、安全管理卡,数据面全在卡上;
  • Nitro Security Chip
    :硬件信任根,固件验签、防篡改;
  • Nitro Hypervisor
    :裁剪到极致的 KVM,只管 CPU 和内存分配,没有设备模拟——设备全在卡上。

2022 年 re:Invent 发布的 Nitro v5 是第五代卡:PCIe 5.0 + DDR5,官方口径 PPS 提升 60%、延迟降低 30%、每瓦性能提升 40%,首发搭载 C7gn 实例,配套自研的 SRD 传输协议——多路径喷洒、乱序交付,绕开 TCP 的单路径拥塞。

Nitro 的成功一半在硬件,一半在敢把宿主机删到只剩一个 hypervisor。软件越少,攻击面越小,bug 越少,CPU 越干净。这是系统思维,不是硬件思维。

阿里云的神龙和 CIPU

阿里云走的是同一条路,按官方口径是四代演进:第一、二代神龙解决计算虚拟化的开销,自研 hypervisor 把这部分做到接近零;第三代神龙用 MOC 卡把存储和网络的转发也硬件化;2021 年云栖大会发布第四代神龙架构(CIPU 2.0 架构),承载第九代 ECS 企业级实例。2022 年 6 月,这颗芯片正式命名为 CIPU——Cloud Infrastructure Processing Unit,云基础设施处理器。

定位上,CIPU 脱胎于神龙的软硬一体架构,是它的硬件部分;CIPU 之后,"神龙计算"被重新定义为纯软件。整体架构就是"飞天 + CIPU"。

飞天 + CIPU:软件定义,硬件加速飞天云操作系统调度 / 计费 / 运维向下:硬件加速向上:接入飞天CIPU(云基础设施处理器)网络 / 存储 / 安全 / 管理,全部硬件化云化计算/存储/网络资源资源池化计算 / 存储 / 网络资源池服务器集群、分布式存储、交换机VPC / eRDMAESSD 云盘安全隔离管理控制CIPU 是神龙架构的硬件部分;CIPU 之后,神龙计算被重新定义为纯软件

图:CIPU 向下云化硬件资源,向上接入飞天

两个值得展开的点。一是 eRDMA:依托 MOC 卡的弹性 RDMA,让普通 ECS 实例也能用上 RDMA,低延迟大规模通信,AI 训练场景的主推卖点。二是磐久 128 超节点(2025 云栖):集成了自研 CIPU 2.0 芯片和 EIC/MOC 高性能网卡,单柜支持 128 个 AI 计算芯片——CIPU 已经从 ECS 延伸到 AI 基础设施。

微软 Azure

微软的路线不太一样,先是 FPGA 路线的代表。2015 年前后起步的 Catapult/AccelNet,先在 Bing 做搜索加速,后来大规模用在 Azure 网络上,论文《A Cloud-Scale Acceleration Architecture》是这条路线的奠基之作。

Ignite 2022 上,微软宣布了 Azure Boost:把虚拟化、网络、存储从宿主机卸载到专用硬件加软件的系统。2023 年初收购 DPU 初创公司 Fungible,2024 年 11 月公开 Azure Boost DPU,技术来源就是 Fungible。下一代 Azure Boost 在 2026 年 5 月 GA。

从 FPGA 加速卡走到自研 DPU,中间隔了一次收购。连微软都要靠买团队补芯片这一环,自研 DPU 的门槛可见一斑。

谷歌

谷歌的硬件是和 Intel 联合开发的 Mount Evans(Intel 型号 E2000),ASIC 路线的 IPU,200Gbps,2021 年公布、2022 年上市,后继型号 E2200(Mount Morgan)在 Hot Chips 2025 亮相。配套的信任根是 Titan 安全芯片,和 Nitro Security Chip 同一个思路。

软件侧更有意思。谷歌的主机网络不是 OVS,是自研的用户态网络栈 Snap(SOSP'19 论文)和存储 IO 系统 Pony Express,2016 年前后就开始部署。把 Snap 的 RPC 栈卸载到 IPU 的核上,能收回约 8 个宿主核,VM turbo 性能提升约 11.2%——这是谷歌官方给的数字。

谷歌的例子说明一件事:卸载的对象不一定是 OVS,软件栈长什么样,决定了卸载的形态。

芯片厂商

四大云自研自用,芯片厂商卖卡给二线云和企业。这一节的重点是 NVIDIA——"DPU"这个词就是它在 2020 年前后提出的。

NVIDIA BlueField 家族:带宽和核数一路翻倍BlueField-12019100G16 Arm 核BlueField-22020200G加密卸载增强BlueField-32022400G16 Arm 核 · SuperNIC 形态BlueField-42025 发布 · 2026H2 出货800G64 Arm 核卡上跑独立 Linux(DOCA 软件栈);BlueField-4 归入 Vera Rubin 平台一代

图:BlueField 四代演进,规格发布来自 GTC DC 2025

BlueField-4 的方向明显转向了 AI 基础设施:2026 年 3 月 GTC 上发布 BlueField-4 STX 存储架构,面向 agentic AI 的推理存储;CES 2026 上的 Context Memory Storage Platform,用 BlueField-4 把 KV cache 扩展到 GPU 机架之外。通用计算的卸载还在,但叙事重心已经换了。

AMD 在 2022 年花 19 亿美元收购 Pensando。第三代 Salina 400 DPU(2024 年 10 月发布)支持 400GbE,片内 232 个 P4 可编程引擎,官方口径性能较上代翻倍;同期发布的 Pollara 400 是首款符合 UEC(Ultra Ethernet Consortium)标准的 AI 网卡。P4 可编程流水线是它和固定流水线 ASIC 的差异点。

Intel 有两条线:FPGA 线(PAC N3000/N6000,Altera 业务 2025 年已出售股权)和 ASIC IPU 线(E2000 → E2100 → E2200),E2100 是不带谷歌定制的通用型号。Marvell 的 OCTEON 10、Broadcom 的 Stingray 也在场内,不展开。

五家 DPU 的关键时间点2017 · AWS Nitro 商用2021 · Mount Evans(与 Intel)阿里第四代神龙(CIPU 2.0 架构)2023 · 微软收购 Fungible2025 · BlueField-4 发布2020 · NVIDIA 提出 DPU 概念2022 · 阿里云发布 CIPUNitro v5 · Azure Boost 宣布2024 · Azure Boost DPU 公开AMD Salina 400 · Pollara 4002026 · 新一代 Azure Boost GA · BF-4 出货

图:2017 到 2026,九年时间这条赛道完成了从立项到定型

芯片厂商卖得了卡,卖不了控制面。控制面是云操作系统的一部分,这决定了 DPU 这门生意的结构——第六章细讲。

四、卸载了什么

前面讲了谁在做,这一节讲做了什么。卸载的东西分三个平面。

网络平面:VXLAN/Geneve 封解装、VPC 路由、安全组和 ACL、conntrack、负载均衡转发、RDMA(RoCE/eRDMA)。租户看到的还是标准 virtio-net 或 ENA 网卡,封解装和策略全在卡上完成。

存储平面:给 guest 呈现 virtio-blk 或 NVMe 前端,后端走 NVMe over Fabrics 接分布式存储——EBS、ESSD 都是这个模式。加密(XTS-AES)、压缩在卡上完成。租户的感受是:远程盘用出了本地盘的延迟和 CPU 占用。

安全与管理平面:硬件信任根、固件验签、度量启动;BMC 的管理功能收进卡里,卡成为唯一的管理入口,宿主机对租户和运维都是干净的。

卸载前 vs 卸载后传统宿主机:什么都靠 CPU宿主机 CPU租户 VM(业务)virtio-net / virtio-blk 后端模拟OVS 转发 · VXLAN 封解装安全组 · conntrack · 存储加密数据面 + 控制面全在宿主 CPU十几个百分点的 CPU 交给基础设施卸载DPU 宿主机:CPU 只跑租户宿主机 CPU租户 VM(业务)薄 hypervisor:只管 CPU/内存DPU(Nitro / CIPU / BlueField)数据面:封解装 · 安全组 · 存储 IO · 加密控制面:Arm 核 + 管理 agent租户无感知,前端接口不变算力还给租户:网络、存储、安全,全部在卡上处理

图:同一台服务器,卸载前后的分工

工作
卸载前在哪
卸载后在哪
租户视角
VXLAN 封解装
宿主机 CPU(OVS)
网卡流水线
无感
安全组规则
宿主机 CPU(conntrack)
网卡查表
秒级生效不变
virtio 后端
宿主机 CPU
网卡
设备型号不变,热迁移不变
块存储 IO 路径
宿主机 CPU + 软件栈
网卡直通存储集群
延迟更低更稳
管理 / BMC
宿主机带外
网卡
宿主机无管理口

关键工程点是前端接口不变——guest 里看到的还是 virtio 和标准网卡型号。卸载的是实现,不是接口。这是热迁移、镜像兼容、租户无感的前提。

五、关键技术机制

SR-IOV 直通的问题前面说过:VF 数量几十个封顶,控制面在宿主内核,热迁移要拔 VF。云厂商要的是"直通的性能 + 半虚拟化的控制面",所以有了下面这些机制。

OVS 硬件卸载:首包走慢路径,后续包走快路径宿主机OVS 软件判策略、装流表网卡 e-switch硬件流表,线速转发流表下发租户 VM(SR-IOV VF)首包:慢路径(软件)后续包:快路径(硬件线速)

图:switchdev / representor 模型的经典路径

这就是 switchdev / representor 模型:每个 VF 在宿主侧对应一个 representor 口,首包走慢路径,由宿主机的软件判定策略;命中之后流表下发到网卡 e-switch,快路径直接在卡上转发。这是"卸载但不失控"的标准答案,也是各家 DPU 的前身技术。

vDPA(virtio Data Path Acceleration)是更彻底的一步:硬件直接实现 virtio 数据面,virtqueue、描述符环都按 virtio 规范放在卡上,控制面仍走标准 vhost 接口。guest 里的驱动不用改,热迁移语义不变,换一代卡对上层透明。"卸载但保持接口不变",这是目前最优雅的工程实现。

控制面放在哪,是两种架构哲学的分界线。一种在卡上的 Arm 核跑 Linux 加云厂商 agent,BlueField、Pensando 走这条;另一种控制面完全在带外,卡只做纯数据面,Nitro 更接近这种。

流水线用 P4 可编程(Pensando 的 232 个 MPU 引擎)还是固定流水线 ASIC(Nitro、CIPU),取舍也很实在:P4 灵活,但要自己养编译器和生态;ASIC 性能功耗最优,但改功能要改芯片。云厂商迭代速度快、功能多,选哪边取决于团队结构。

最后看三档转发方式的量级对比。

转发方式
转发位置
单核 PPS 量级
CPU 占用
灵活性
内核 OVS
内核态
百万级
最灵活,全软件定义
OVS-DPDK
用户态独占核
千万级
核被独占
较灵活
网卡硬件卸载
网卡流水线
线速,不依赖 CPU
接近零
受卡上能力集约束

注:量级为示意,实际随包大小、流数量、功能集变化。

六、DPU 到底省了什么

技术讲完,算钱。云厂商视角是一笔毛利账:虚拟化管理开销按 10%~30% CPU 量级(视负载,网络/存储密集型偏高),卸载之后这部分变成可售算力,直接进毛利。附带收益还有三样:宿主机功耗下降,同机房可售密度上升,攻击面缩小——宿主机连管理口都没有了。

租户视角,有三件看得见的事:

  • 算力不打折。
    没有邻居的虚拟化开销来抢 CPU;
  • 延迟更稳。
    网络、存储路径不经过宿主机调度抖动;
  • 裸金属平民化。
    Nitro、CIPU 让裸金属实例能像 VM 一样用 VPC、云盘、安全组,分钟级交付——这是卸载做到位之后才可能有的产品形态。

成本侧也要把话说全:一颗 DPU 加整套软件栈,是数十亿美元级别的投入,每一代都要重新流片。所以这门生意只有超大规模云厂商玩得转——AWS、阿里云、Azure、谷歌全部自研或收购,没有一家纯靠买卡搭出生产级控制面。

这也解释了为什么 DPU 在企业私有云卖不动。云厂商需要 DPU 的根本原因是"宿主机不可信 + fleet 级弹性控制面"。企业自己的机房里,宿主机是自己的,信任模型不存在,SR-IOV 加 OVS-DPDK 就够用。DPU 的价值一半在卡,一半在云操作系统——卡买得到,控制面谁来写?企业的运维团队没有这个编制。所以 2020 到 2022 年 DPU 被炒成"第三颗芯片",企业侧的销量一直没起来,NVIDIA 的叙事重心后来整体转向了 AI 网络。

一句话:DPU 是云操作系统设备驱动层的实体化,不是通用服务器配件。

七、AI 时代的新角色

通用计算的卸载已经定型,AI 是 DPU 叙事的新战场。它在 AI 集群里的角色一分为二。

一是计算网络,管 GPU 之间的通信:RDMA/RoCE、拥塞控制、多路径包喷洒。NVIDIA 的 Spectrum-X(以太网加 SuperNIC 的组合)和 AMD 的 Pollara 400(首款 UEC 合规网卡)都在这条线上,对手是 InfiniBand——UEC 联盟(AMD、Broadcom、微软、Meta 等)想用以太网在 AI 训练网络里抢 IB 的份额。

二是存储与安全网络,管集群外围:checkpoint 读写、KV cache 分层存储、多租户推理隔离。NVIDIA CES 2026 的 Context Memory Storage Platform 就是拿 BlueField-4 把 KV cache 扩展到 GPU 机架之外,BlueField-4 STX 是存储侧的代表作。

DPU 在 AI 集群里的两个角色计算网络:GPU 之间GPU 节点SuperNIC / RoCEGPU 节点SuperNIC / RoCEGPU 节点SuperNIC / RoCEGPU 节点SuperNIC / RoCERDMA · 拥塞控制 · 多路径包喷洒(SRD / UEC)存储与安全网络:集群外围AI 计算节点DPU分布式存储集群checkpoint · KV cache 分层 · 多租户隔离(BlueField-4 STX 等)

图:计算网络要低延迟,存储安全网络要隔离和带宽

SuperNIC 和 DPU 的区别要点破:SuperNIC 面向 GPU 通信做深度优化——低延迟、拥塞控制、网络遥测,不做完整的基础设施卸载。同一家的芯片,两种产品定义。

AI 集群规模越大,网络在总成本里的占比越高,网卡端的智能就越多。DPU 这些年攒下的技术储备——可编程流水线、Arm 核、RDMA 引擎——正好复用到这条线上。这是 NVIDIA、AMD 坚持做网卡的真实原因。

八、开源与标准生态

DPU 的开放生态主要看 OPI Project(Open Programmable Infrastructure),Linux Foundation 2022 年 6 月成立,目标是给 DPU/IPU 做厂商无关的软件抽象。2025 年发布了第一个协同版本 OPI Abstraction v0.1.0,同年 10 月在 OCP 全球峰会旁办了第一届 OPI Summit。

其他拼图包括 IPDK(基础设施编程开发套件)、DPDK、P4.org,以及 virtio/vDPA 规范。

实话实说:头部云的 DPU 栈全是闭源的,Nitro、CIPU、Azure Boost 都不开放,开放生态的实际服务对象是芯片厂商的卡、二线云和私有云试点。标准组织的意义在于不让 DPU 的编程模型碎片化到每家一套 SDK,离开箱即用还远。

九、结尾

DPU 不是一颗新芯片,是云操作系统设备驱动层的硬件化——hypervisor 的数据面从软件搬进了硅片,宿主机终于变回了一台纯粹的计算机。

按身份给三个判断:

1用公有云的:不用关心 DPU 是什么,你买的第九代 ECS、C7gn 已经在用了,享受算力不打折就行。

2自建机房的:别买 DPU。SR-IOV 加 OVS-DPDK 够用,除非你有 fleet 规模的控制面团队。

3建 AI 集群的:网卡选型(RoCE/UEC/SuperNIC)现在是真问题,比 DPU 本身更值得花时间。

趋势上,通用计算的虚拟化卸载已经定型,格局是头部云自研加芯片厂商卖卡给二线;AI 网络是第二增长曲线,DPU 和 SuperNIC 的边界会继续模糊。下一个十年的看点不在卸载本身,在网卡上的可编程算力会参与到什么程度。

· · ·

文中数据截至 2026 年 8 月,厂商官方口径均已在正文注明。