乐于分享
好东西不私藏

英伟达对Blackwell进行全面软件推理优化,DeepSeek V4推理成本降低了5倍

英伟达对Blackwell进行全面软件推理优化,DeepSeek V4推理成本降低了5倍

英伟达最近发布了一篇技术博客,在 DeepSeek V4发布一个月后,其全栈推理软件对 Blackwell GB200 和 GB300 做了全面的优化,而得到的成绩相当惊人。Token 成本降低了5倍,如下图:

可以看到横轴 45 tokens/sec/user 上,每百万成本从 0.06,特别说明英伟达使用单 Token 成本来衡量其软硬件水平的。

英伟达解释了软件栈对推理的重要性,Agentic AI 时代,智能体要推理、规划、调用工具、子智能体启动、多轮工作流要管理大量上下文,而支撑智能体不仅仅需要GPU,更需要CPU、DPU、存储,一个简单的请求可能就是一个复杂的分布式问题。

为了降低单 Token成本,英伟达在软件栈上主要攻坚了三个部分。

生产运维:协调分布式服务、编排、自动扩缩容和内存管理,确保推理任务能够在合适的计算和存储资源上运行。

应用加速:能够为开发人员提供调优和定制的空间,从而以更高性能运行模型,这方面CUDA是英伟达的优势。

基础设施访问:英伟达 GPU、网络、内存、系统功能等基础设施能够让开发者更容易访问,不用写过多的代码。

通过上面三个准则,英伟达 抽象出了整体架构,如下图:

通过更层面的优化,产生了复合效应,吞吐量提高了20倍,如下图:

Disaggregated Serving 就是NVLink互联技术,Large Expert Parallelism 是大规模专家并行技术,NVFP4 精度的4 bit量化技术,MTP 多 Token技术。

从这篇文章也学到,大规模模型推理不仅仅取决GPU等硬件,而是一个综合的技术优化工作。 

欢迎进微信群聊AI,目前已满200人,只能采取邀请方式,感兴趣的看看这篇文章