夜雨聆风学习资料网

ARTICLE · 1145019

推理服务网关卸载到 DPU:Scale-In 层的实

推理服务网关卸载到 DPU:Scale-In 层的实

推理服务网关卸载到 DPU:Scale-In 层的实

前阵子 ServeTheHome 去 F5 加州实验室转了一圈,发现他们把 AI 推理的网关功能,直接塞进了 NVIDIA BlueField-3 DPU 里。

以前这些路由、限流和安全策略都跑在主机 CPU 上。现在挪到了 DPU 这个独立器件里。实测下来,同等负载下主机核占用从 12 核掉到了 2 核。F5 自己披露的数据更猛:GPU 显存顶到峰值时,推理吞吐直接翻了 3 倍。

为啥非得折腾这一出?因为大模型推理不是普通网页请求。它是一个长连接接着一个 token 流。路由和限流的消耗跟着用户数和 token 量涨,跟 GPU 数量没关系。这活儿没法靠堆 GPU 解决,只能找个不抢算力、又刚好卡在网络必经之路上的硬件来扛。

而且现在大模型老爱调外部工具,攻击面都跑到编排层去了。把这些出口流量全收拢到 DPU 上统一做防火墙和审计,策略才不会乱。

以后评价一颗国产 DPU 行不行,就看它能不能在主机外面,把 token 级的治理也接过去。

原文推理服务网关卸载到 DPU:Scale-In 层的实测与架构含义
北京,1小时前,

相关学习资料