乐于分享
好东西不私藏

当CPU也拥有AI加速能力后,还需要GPU吗?(附下载)

当CPU也拥有AI加速能力后,还需要GPU吗?(附下载)

过去十多年,GPU几乎就是人工智能与高性能科学计算的代名词。大模型训练、气候模拟、材料仿真,几乎所有重度计算任务,第一选择都是GPU。但一篇来自顶尖学者的论文抛出了一个颠覆性问题:未来,我们是否还必须依赖GPU?

这篇由超算领域泰斗Jack Dongarra、苏黎世联邦理工Torsten Hoefler、日本理化学研究所(RIKEN)的松冈聪共同完成的论文《Do We Still Need GPUs?》提出核心观点:GPU并非不可替代。随着CPU不断进化,集成矩阵运算硬件、高速高带宽内存之后,改良版CPU完全可以胜任绝大多数AI与科学计算任务;不过在最顶尖的超大模型训练场景,GPU依旧会占据重要地位。(文末附下载)

GPU凭什么统治AI与超算?

GPU最早是为游戏图形渲染而生,擅长同时处理成千上万条并行计算任务。大约20年前,人们发现这套架构可以拿来做通用科学计算,就此开启GPU加速时代。

GPU的核心优势有三点:

  • 巨大的浮点运算吞吐量,对矩阵乘法这类AI核心计算效率极高;
  • 极高的内存带宽,可以快速给计算单元输送数据;
  • 原生支持低精度运算,专门的张量核心,完美适配深度学习。

于是大量AI框架、科学仿真软件都围绕GPU来开发改写。但GPU大行其道,不是因为GPU天生就是唯一解,而是过去传统CPU太慢了,内存带宽太窄,精度也不灵活。

也就是说,如果CPU补齐这些短板,CPU和加速器之间的边界就会变得模糊。评判硬件好坏,不再看它叫“CPU”还是“GPU”,而是看它实际具备的计算能力、内存性能、编程友好度。

新一代增强CPU,正在补齐GPU曾经独占的能力

如今新一代CPU已经开始把过去GPU独有的能力直接做到处理器内部,典型代表就是ARM的SVE/SME向量与矩阵扩展指令集、Intel的AVX/AMX高级矩阵扩展。同时CPU封装内部直接搭载HBM高带宽内存,原生支持从FP64双精度一直到FP4极低精度的多种数值格式。

这套升级后的CPU拥有几大关键优势:

消除数据搬运的巨大开销

现代高性能计算里,数据移动才是真正的成本,远比计算本身更耗电、更耗时。

传统异构系统中,CPU负责调度,GPU负责计算,数据需要在主机内存和GPU显存之间来回拷贝。就算有统一内存、高速互联技术,依然会带来延迟、额外功耗,还增加了软件编程的复杂度。

而把矩阵加速硬件集成进CPU内核,全部计算都跑在同一套内存空间里。操作系统、任务调度、复杂逻辑控制、矩阵AI运算全部由同一颗处理器完成,不用反复搬运大量数据。

同时适配AI大模型和复杂科学仿真

AI的核心工作大多是规整的矩阵乘法、注意力计算,但真实世界的科学计算远比这个复杂。气候、物理、化学仿真里充斥大量稀疏矩阵、不规则数据、分支判断、自适应网格、多尺度耦合算法。

GPU面对规整稠密矩阵的时候所向披靡,但是处理分支多、访问模式杂乱的任务时,效率会大打折扣。很多科学程序要被迫拆成两部分:一部分交给CPU处理复杂逻辑,一部分交给GPU跑矩阵运算,中间还要来回传输数据。

增强型CPU则可以一手抓两样:内置矩阵引擎搞定AI张量运算,同时保留CPU传统强项,擅长处理复杂控制流、不规则计算。很多几十年积累下来的大型科研代码,不需要彻底推倒重写,基于现有的OpenMP、MPI、各类数学库就可以继续迭代,大幅降低科研人员的开发门槛。很多科研人员专长是物理、气候、化学,并不是GPU内核调优专家,CPU路线对他们更加友好。

多精度混合计算,兼顾AI和科学计算需求

AI推理、微调大量使用BF16、INT8甚至FP4低精度,而科学仿真又离不开FP64双精度保障数值稳定性。

过去低精度矩阵加速被认为是GPU的专属,实际上这只是硬件功能,并不是GPU的专利。集成矩阵引擎的CPU可以原生支持全套精度:低精度完成大规模计算,高精度做结果校正,需要的时候启用双精度。这种混合精度能力,既可以跑量化大模型推理,也适配迭代求解器、AI辅助仿真这类前沿科研工作。

系统整体更均衡,不盲目追逐理论峰值算力

很多人选购硬件只看硬件标称的最高每秒浮点运算次数。但真实程序很少能跑满这个理论峰值。

GPU往往纸面峰值算力极其亮眼,但内存容量、网络、功耗、软件适配未必可以同步跟上。增强CPU不一定拥有最夸张的峰值算力,却更容易做到整套系统均衡:算力、内存带宽、内存容量、网络、功耗、编程难度综合平衡。对于实际业务,解决问题的耗时、耗电量、开发难度,远比纸面参数重要

哪些场景CPU已经能打?哪些场景GPU暂时不可替代?

论文把应用分成不同场景,给出清晰的边界:

✅ CPU矩阵加速更占优势的领域

  • 大模型推理、模型微调;
  • 科学机器学习、替代模型、图神经网络;
  • AI和仿真深度耦合的融合工作流:仿真和大模型交替运算,频繁互相交换数据。

这类任务中,数据局部性、系统整合、处理复杂逻辑的能力往往比单纯的矩阵峰值算力更加重要。

不过,GPU依旧保持关键地位。前沿超大模型完整训练依旧高度依赖GPU。要想完全取代GPU做顶级大模型训练,CPU矩阵引擎需要在算力、能效、内存带宽、互联通信、软件生态全部追平GPU,这是一个很高的门槛。

但这并不等于GPU永远不可替代,只是当下工程层面还存在差距。

实测验证:两套ARM CPU的对照实验

光靠理论推演说服力有限,论文配套了一份实证研究,选用两款真实ARM CPU做万亿参数专家混合大模型(Kimi‑K2,256K超长上下文)的推理测试。

  • Fugaku超算A64FX芯片:拥有宽向量单元+HBM高速内存,没有矩阵加速引擎,用来做对照组;
  • 全新上市LX2芯片:保留向量单元,增加SME矩阵引擎,同样搭载HBM内存(性能参数来自官方规格,尚未完成真机实测)。

大模型推理分为两个完全不同的阶段,刚好可以分开验证“内存带宽”和“矩阵算力”两大硬件需求。

解码阶段(Decode):生成输出token,受内存带宽约束

当你问AI一个问题,它回答时是一个字一个字蹦出来的。每生成一个新词,都需要把整个模型的权重和上下文缓存(KV Cache)从内存中读一遍。此时,算力基本闲置,内存带宽才是瓶颈

实测A64FX上,Decode阶段约80%的时间花在等待数据从HBM传输到计算单元,浮点运算占比不足1%。因此,Decode速度直接正比于总内存带宽。有趣的是,48个A64FX节点加起来的总带宽,恰好相当于一个英伟达GB200 NVL4 GPU节点。也就是说,在Decode这个占据推理大部分时间的环节,纯CPU集群已经能和顶级GPU平起平坐,而且这个CPU连矩阵引擎都没有。

预填充阶段(Prefill):处理输入提示词,算力密集

把用户输入一大段文本喂给模型,一次性处理全部输入token,这就是预填充。这个环节是稠密矩阵计算,极度吃矩阵算力。没有矩阵引擎的A64FX在这里性能落后顶级GPU大约47倍。要追平性能,矩阵引擎需要提供的算力取决于对标什么样的GPU配置:

  • 现实业务(开启稀疏注意力优化):需要约80TF算力;
  • 无任何优化、追求极限峰值的硬件跑分:需要750TF以上算力。

新的LX2芯片官方规格BF16算力240TF,INT8算力960TOPS,已经跨过现实业务需要的门槛。但要注意:这是基于芯片参数推算的结果,还需要真机跑一遍来最终确认。

三大短板

论文也客观承认CPU路线当下还有三个明显短板,但作者认为这些都不是CPU架构天生缺陷,随着下一代硬件更新可以逐步解决:

高速互联网络决定并行效果

万亿参数大模型需要上百个节点协同工作,有两种分布式方案:

  • 张量并行TP:单层网络切分到多个节点,节点之间需要频繁全局集合通信;
  • 流水线并行PP:不同层分给不同机器,只做简单点对点数据传递,通信量小。

如果互联网络带宽弱(类似Fugaku的Tofu-D环形网络),张量并行会被网络堵死,改用流水线并行就可以绕开瓶颈;如果网络性能足够强,张量并行就可以正常发挥实力。CPU集群不是天生通信差,只需要配套对应的高速互联硬件,再配合适配的并行策略,就可以规避问题。

功耗还有差距,根源来自内存代际

按照当前硬件测算,全LX2 CPU集群完成相同推理任务,每用户功耗是最新HBM3e GPU的1.75‑2.7倍。

但功耗差距主要两点:LX2用的是旧一代HBM2内存,而最新GPU使用新一代HBM3e,每瓦可以输出更高内存带宽;同时LX2还缺少FP8硬件支持。

未来CPU切换HBM3e内存,芯片增加FP8单元,绝大部分功耗差距就可以被抹平。这属于硬件更新换代问题,不是CPU架构本身硬伤。

FP8硬件缺失,尚待下一代芯片实现

目前LX2只支持INT8、BF16,缺少FP8。现在还需要进一步验证,只用INT8是否足够保障超长上下文推理精度;ARM规划的下一代SME矩阵扩展会补齐FP8硬件。

同时还存在一个很有前景的研究方向:能不能利用低精度矩阵引擎,通过数值分解算法,间接实现高精度FP32、FP64科学计算。如果该技术成熟,未来一套矩阵硬件就可以同时服务AI推理和高精度仿真,不过该想法目前还处在研究假说阶段,没有完全落地。

CPU能取代GPU吗?

论文给出一个非常务实的判断:

  • 对于前沿大模型训练(如GPT-5级别),GPU仍将是主力。因为训练需要极致的密集矩阵吞吐、超大规模分布式通信和成熟的软件生态,CPU短期内难以全面超越。
  • 但对于推理、微调、科学机器学习、代理模型、图神经网络,以及嵌入仿真流程中的AI任务,加速后的CPU反而更优,因为数据不用搬迁,编程更简单,还能同时处理稀疏/不规则计算。

更重要的是,科学计算正在走向融合:未来一个气候模拟程序,可能同时包含传统偏微分方程求解、数据同化、不确定性量化和神经网络代理。这种混合工作流既需要FP64高精度,也需要低精度张量吞吐,还需要复杂的控制逻辑和MPI通信。一个集成矩阵引擎的CPU,天然适合这种“既要又要”的场景,而CPU-GPU异构则会带来频繁的数据搬运和编程噩梦。

论文标题问“Do We Still Need GPUs?”,答案是如果CPU继续吸收GPU的长处(宽向量、矩阵引擎、高带宽内存、多精度支持),那么GPU作为独立硬件的必要性就会逐渐消失。我们真正需要的不是某个设备的名字,而是一组能力:高带宽、高吞吐矩阵运算、灵活精度、强通用性、易编程。

未来,芯片的形态可能不再是“CPU + GPU”,而是“通用处理器 + 专用加速器”的混合体,但那个通用处理器本身已经足够强壮,能扛下大部分重活。正如作者所说,这不是“CPU vs GPU”的战争,而是架构的趋同。

SDNLAB公众号后台对话框私信260818即可下载!