乐于分享
好东西不私藏

每日AI知识点:GPU

每日AI知识点:GPU
一台服务器,卖700万人民币,还抢不到。

这不是什么限量超跑,也不是什么豪宅,而是一台搭载了 8块英伟达B300 GPU 的AI服务器。去年年底,它的价格还在400万左右徘徊,半年时间,近乎翻倍。

更夸张的是,就算你愿意掏这700万,也不一定拿得到货。

这AI服务器,凭什么这么贵?

答案就藏在它的核心:GPU芯片。

今天我们就来聊聊:GPU到底是什么、它是怎么工作的,以及为什么到了AI时代,它突然变得这么重要。

1、什么是GPU

GPU,全称Graphics Processing Unit图形处理器。说白了,就是一种专为并行计算设计的处理器。

你可能更熟悉它的另一个名字:显卡。其实,显卡是一整块电路板,而GPU是显卡上那颗最核心的芯片,就像电脑主板上那颗CPU一样。

GPU这个概念,最早可以追溯到1999年。那一年,英伟达发布了GeForce 256,第一次正式提出了GPU这个说法。

在此之前,显卡只是个帮CPU画图的辅助部件。到了GeForce 256这里,GPU开始自己扛起大量图形计算工作。

但GPU真正出圈,也就是这几年的事。AI大模型爆发,直接把GPU从“游戏卡”推上了“算力卡”的王座。如今,高端GPU已经是训练和部署AI模型的绝对主力。

2、GPU是怎么干活的

要理解GPU怎么干活,得先搞明白它和CPU到底有什么不一样。

CPU,像几位“教授”。 每个教授都博学多才,能搞定各种复杂难题。但教授数量少,一般就几个到十几个。

GPU,像成千上万名“小学生”。 每个小学生只会最简单的加减乘除,单拎出来啥也不是。但架不住人多,几千甚至上万个同时开工。

这就是GPU和CPU最根本的设计差异:

CPU追求低延迟,恨不得让单个任务瞬间完成;

GPU追求高吞吐量,讲究单位时间内搞定尽可能多的任务。

具体到技术层面,GPU的核心设计模式叫 SIMT(单指令多线程),所有计算核心执行同一条指令,但处理各自不同的数据。

举个例子:渲染一张1080P的图像,需要处理大约200万个像素。如果用CPU逐个像素去算,每个像素都要单独过一遍,效率低得感人。但GPU不一样,它可以把这200万个像素拆成200万个独立小任务,让几千个核心同时开工,一人算一个。这就是为什么打游戏时,显卡越好画面越流畅,每一帧画面里那几百万个像素点,全是GPU在同时计算。

除了CUDA核心,现代GPU还藏着一个专为AI准备的“秘密武器”——张量核心(Tensor Core)。这玩意儿专门为深度学习中的矩阵运算而生,处理AI模型训练和推理时,效率比普通核心高出好几个量级。

GPU干活的基本流程是这样的:

CPU派活:CPU通过驱动程序,把计算任务扔给GPU;

GPU拆解:GPU把大任务拆成成千上万个小任务;

并行计算:几千个核心同时开工,各算各的;

结果汇总:GPU把算完的结果拼在一起,交回给CPU。

3、GPU是怎么从游戏卡变成算力卡的
GPU最初的任务只有一个:让游戏画面更好看
1999年的GeForce 256,第一次把3D图形计算从CPU手里接了过来。2001年,英伟达GeForce 3引入了可编程着色器,开发者可以自己写代码控制光影效果。此后的十几年,GPU一直在游戏和3D建模领域深耕。
真正的转折发生在 2006年。那年,英伟达发布了 CUDA(Compute Unified Device Architecture)平台
CUDA做了一件革命性的事:让开发者可以用标准的编程语言(比如C/C++)直接调用GPU的算力,而不是只能用它来画图。
打个比方:在此之前,GPU的算力就像一座被高墙围住的宝藏,只有图形渲染这一条路能进去。CUDA直接在墙上开了一扇大门,告诉全世界的开发者:进来吧,这里的算力随便用。
从那以后,科学家用它加速物理模拟,金融公司用它做风险预测,研究人员用它训练神经网络。GPU从“游戏卡”一步步变成了“通用计算加速卡”。
到了2010年代,深度学习迎来爆发。神经网络的核心运算就是矩阵乘法——大量的、重复的、可以同时算的矩阵乘法。而这,恰恰是GPU最擅长的领域。
于是,GPU彻底完成了从游戏玩家的装备到AI公司的命根子的身份切换。

4、GPU凭什么这么贵

  • 它真的太难造了。
以B300为例,它采用台积电4NP工艺制造,集成了超过20480个CUDA核心、288GB的HBM3e高带宽内存。一块小小的芯片上,要塞两万多个计算核心、几百GB的内存、复杂的互联电路,制造难度和成本都高得离谱。
  • 因为它真的太快了。
B300的FP4张量核心算力达到15 PFLOPS,也就是每秒进行1500万亿次浮点运算。相比上一代B200,性能提升了50%,是目前全球最先进的GPU芯片之一。
  • 因为它真的耗电。
每块B300的功耗高达1400W。一台8卡B300服务器,总功耗差不多15KW,跑一天的电费就是好几百块。
  • 所有AI公司都在抢它。
训练AI大模型、部署AI智能体,统统离不开GPU。需求太猛,供应跟不上,价格自然飞涨。
没有GPU,就没有今天的大语言模型,没有AI绘画,没有自动驾驶,也没有那些能自己干活的AI智能体。它就像工业时代的蒸汽机、信息时代的CPU——它是AI时代的“发动机”。
对我们普通人来说,可能一辈子也不会买一块B300。但当你打开AI对话、让AI生成一张图片、或者生成一段视频时,背后都有成千上万块GPU在默默计算。
它耗电,它昂贵,它一芯难求。但正是这块小小的芯片,撑起了我们正在经历的这场AI革命。

以上,如果觉得内容有用,点个赞、推荐、转发三连吧。谢谢你看完,下次见。