乐于分享
好东西不私藏

政企AI项目算力通识 · 第3篇:一台 AI 服务器里发生了什么——从芯片到整机柜

政企AI项目算力通识 · 第3篇:一台 AI 服务器里发生了什么——从芯片到整机柜

写给甲方 IT 的硬科技白话课 · 本文为系列第 3 篇

前两篇我们聊了"算力三兄弟怎么选""信创靠不靠谱",有读者追着问:"道理我都懂,可厂商甩来的配置单,满篇 8 卡、HBM、NVLink、PCIe 6.0,我一个都看不懂,怎么知道他没坑我?"

同样,这篇从两个视角讲:基础知识视角拆零件、讲原理——HBM 显存、NVLink、PCIe、Chiplet、统一内存到底是什么;项目实际视角给清单、讲踩坑——配置单怎么审、整机柜怎么算电和冷、采购验收怎么写条款。读完你至少能自己看懂配置单上的关键五项,不再被"卡数"两个字牵着走。

一、基础知识:打开机箱,一台 AI 服务器里到底有什么

咱们先把一台 AI 服务器想成一台"特别能干的电脑"。普通电脑里有的,它都有;普通电脑没有的,它也得有。从外到内,主要零件就这几样:

CPU(中央处理器)

全能管家,管调度和通用活

  • 负责系统启动、任务分配、数据预处理、和外面网络通信
  • AI 服务器里 CPU 核心数往往很多(几十到上百核),为的是"喂得饱"下面的加速卡

加速卡(GPU / NPU)

真正干 AI 重活的"搬砖大队"

  • 一块卡上除了计算单元,还自带一块"手边显存"(HBM)
  • 一台机器能插多张,卡与卡之间要靠"互连"连起来协同

内存(DDR)

CPU 这边的大仓库

  • 给 CPU 干活用的普通内存,容量大、但速度比显存慢

网卡(高速网卡)

机器对外的高速出口

  • 单机多卡还不够,多台机器组网才成集群,网卡带宽决定"对外吞吐"

SSD(固态硬盘)/ 电源 / 主板

存储、供电、骨架

  • 主板上的 PCIe 总线,是把 CPU、卡、网卡"串起来"的高速公路
  • 电源要扛住全部零件的总功耗,余量不够会宕机

记住这个画面,后面每讲一个名词,你都能在机箱里给它找个位置。对甲方来说,真正决定这台机器"强不强、贵不贵、机房喂不喂得起"的,往往不是最显眼的"卡数",而是卡旁边的显存、卡之间的互连、以及整机柜的功耗——这正是厂商最爱模糊处理的地方。

二、基础知识:显存(HBM)——决定你能跑多大模型的那块"手边货架"

先讲显存,因为它最容易让甲方栽跟头。很多人挑机器只看"算力多少 TFLOPS",但真跑起大模型,第一个撞上的天花板往往是显存,不是算力。

白话解释:显存是 GPU/NPU 手边的高档货架。模型参数、中间计算结果,都得临时放在这块离计算单元最近的货架上,随用随取。货架太小,大模型根本摊不开——就像你想在厨房做满汉全席,灶台火力再猛,案板只有巴掌大,菜也摆不下。这就是为什么"7B 小模型一台卡能跑、70B 大模型得把几张卡显存拼起来才装得下":不是算力不够,是货架不够。

那 HBM 是什么?它是显存的一种高端形态——高带宽内存,用 3D 堆叠工艺把多层存储颗粒直接摞在芯片旁边,带宽远高于普通 DDR,但容量相对小、成本高。所以你常看到"这台机器单卡显存 80GB、整机上 TB 级"——这个"80GB"决定它能塞下多大的模型,"上 TB"决定它能塞下多大的多卡协同任务。反过来,如果一台机器卡很多、但单卡显存小,跑大模型照样吃力。

甲方决策点:先看你要跑的模型参数量,反推需要多少显存,再选卡数和单卡显存。别被"总算力"晃花了眼——显存不够,算力再高也是英雄无用武之地。具体某模型在某卡上的显存占用与可行部署方式,以模型官方部署文档 / 厂商实测为准,本文不杜撰数字。

三、基础知识:卡间互连——NVLink vs PCIe,为什么"8 卡"有快有慢

这是上篇那个"8 卡旗舰"坑的真相所在。一台机器插了 8 张卡,它们要协同干活,卡和卡之间得通信。通信的"路"有好坏之分,直接决定这 8 张卡是"真·8 卡合力",还是"8 张各干各的、偶尔通个信"。

  • NVLink(一类高带宽卡间互连):卡间的"高速班车专线"。
    专为多卡协同设计,点对点带宽极高、延迟极低,8 张卡像坐专线班车,数据嗖嗖地互相传。跑大模型训练、多卡推理时,卡间要频繁交换大量中间结果,专线的价值就出来了。
  • PCIe(通用总线):卡间的"普通公路"。
    它是电脑里通用的高速总线,啥都能接,但不是为多卡 AI 协同专门优化,带宽和延迟都比专线差一截。8 张卡走 PCIe 互联,相当于大家挤在一条普通公路上,车多就堵。

对甲方意味着什么?同样的"8 卡",NVLink 全互连版和 PCIe 桥接版,跑大模型训练时有效性能能差出一大截,价格也差出一大截。厂商如果拿 PCIe 方案按 NVLink 的价格卖,你就亏了;反之,如果你单位主要是轻量推理、卡间通信不多,PCIe 方案也许够用、还省钱——关键是你得知道自己要的是哪种。所以看配置单,"卡间互连方式"必须写清楚,不能只写"8 卡"

这里插一句基础知识:互连带宽的单位常是 GB/s(每秒传输的字节数),延迟单位常是纳秒级。具体某代 NVLink 或 PCIe 的带宽数值,以厂商官方规格书为准,不同代际差异很大,本文不替你背具体数字——你只要死死记住"专线比公路快、买前问清互连方式"这条原则。

一句话避坑:配置单上只写"8 卡 / 16 卡"却不说互连方式,一律当作信号——要么他也不懂,要么他不想让你懂。两种都得追问。

四、基础知识:Chiplet 与先进封装——芯片为什么像拼乐高

下一个常被厂商拿来唬人的词是"先进封装""Chiplet"。说人话:传统芯片是在一整块硅片上刻出所有电路,越大越难造、良率越低。Chiplet 的思路是——把大芯片拆成几个小芯片(芯粒),再用先进封装像拼乐高一样拼回一个大芯片。每个小芯粒可以单独设计、单独制造,拼起来整体性能更强、成本更可控、也能把不同工艺的零件组合在一起。

对甲方有什么用?两点:第一,它解释了为什么"同样叫 GPU,里面构造可能完全不同"——有的是单片大核,有的是多芯粒拼接,背后是不同厂商的路线选择;第二,它和你单位的供应链与自主可控直接相关(呼应第 2 篇信创)——芯粒拆分后,单一环节的受制面更小,国产化路径更灵活。但注意,Chiplet 是制造端的工艺路线,不改变你选型时该看的"算力、显存、互连、功耗"四项,它只是底层为什么能做到这些性能的原因之一。别让厂商拿"我们用了先进封装"当卖点模糊掉真正该比的参数。

五、基础知识:统一内存与 CXL——CPU 和 GPU 之间的"内存墙"

最后补一个偏底层、但正在变重要的概念:CPU 的内存(DDR)和 GPU 的显存(HBM),传统上是两堵"墙"——数据要从 CPU 那边搬到 GPU 这边,得专门拷贝一次,慢且占带宽。"统一内存"就是想办法让 CPU 和 GPU 看到同一块内存地址,不用来回搬;CXL 是一类新的互连标准,目标是让 CPU、GPU、各种加速器能更高效地共享内存、扩展内存容量

对甲方的现实意义:如果你的业务是"CPU 预处理 → GPU 推理"这种频繁来回搬数据的场景,统一内存 / CXL 类的支持能明显减少搬运开销、提升整体效率。但它目前仍是演进中的技术,不同平台支持程度不一。选型时把它当作"加分项核实",而不是决定项——先确认你的软件栈和框架是否真的用得上,别为用不上的前沿特性多花钱。具体支持情况以厂商平台规格与软件版本为准。

六、项目实际:配置单甲方审阅清单(必看 5 项)

讲完零件,落到你最该会的本事——看配置单。我把八年里反复用的一张《配置单甲方审阅清单》交给你,五项是必看,少一项都别签字:

必看项
为什么必看(甲方动作)
① 卡间互连方式
写清是 NVLink 全互连 / 部分互连 / PCIe 桥接。训练类业务要专线,推理轻量可接受 PCIe。没写=风险
② 单卡显存 + 总显存
反推能跑多大模型。只写"总算力"不写显存的,追问
③ 网卡带宽
单机要组网才有用,网卡带宽决定对外吞吐,和后面集群网络篇联动
④ 电源余量
总功耗是否留有余量(一般建议 10%~20% 冗余),余量不足易宕机、难扩容
⑤ 整机柜功耗
这台机器放进机柜,总功耗多少千瓦?决定机房电、冷、承重——见第七节

上表为审阅框架,不绑定任何厂商型号。具体某型号的互连带宽、显存容量、功耗数值,以厂商官方规格书 / 选型手册为准,本文不杜撰具体数字。审阅时建议要求厂商逐项为每台机器出具书面参数,而非只给汇总"亮点"。

三个真实踩坑(均为脱敏示意)

  • 坑一:"卡数"障眼法。
    某项目报"8 卡旗舰",实际 PCIe 桥接、单卡显存偏小。我们按上面清单一核,跑客户目标模型显存不够,当场要求换方案或调价,省下近一辆车的钱(示意量级)。
  • 坑二:电源无余量。
    配置单总功耗标得刚好卡在电源额定值,没留冗余。后期加一块卡就超,只能整机换电源,工期拖半个月。
  • 坑三:网卡成瓶颈。
    机器算力强、但网卡带宽低,多机一组网,对外吞吐卡在网卡上,集群白建了一半。这正好是下一篇"GPU 集群"要展开的话题。

七、项目实际:别只看单机,整机柜才决定机房的电和冷

这是甲方最容易算漏的一笔账。一台 AI 服务器的"单机参数"好看,不等于"放进机房就好养"。真正决定项目能不能落地的,是它占的整机柜视角:电、冷、承重。

白话讲:AI 服务器是出了名的"电老虎 + 发热怪"。一台高配机器功耗可能顶普通服务器好几台;一个机柜塞几台,整柜功耗就是几十千瓦量级。这带来三个硬约束:

  • 供电:
    机房这路电能不能扛住整柜功耗?要不要增容、走专用回路?增容审批周期常常以月计,不排进项目计划就会卡这儿(呼应第 10 篇要讲的供电账)。
  • 散热:
    这么多热量散不出去,机器会降频甚至宕机。风冷能不能压住、要不要上液冷,方案阶段就得定(第 9 篇专门讲)。
  • 承重:
    满配机柜很重,老机房楼板承重不够要加固,否则不安全。我见过项目货到了才发现楼板要加固、工期翻倍。

所以看配置单,第⑤项"整机柜功耗"不是可选项,是必选项。把单台功耗 × 机柜台数算出来,拿去和机房现有电、冷、承重三本账对一遍,对不上就别签——机器再强,机房喂不饱也是摆设。具体功耗与散热要求以设备规格书和机房勘察为准。

八、项目实际:采购与验收,这几条写进条款

最后给你落到合同层面的动作。基于上面所有点,采购文件和验收标准里,建议把这几条钉死:

环节
要写进的条款(甲方动作)
采购文件
技术要求逐台列清五项(互连 / 显存 / 网卡 / 电源余量 / 整机柜功耗),不接受"系列标配"含糊表述
采购文件
要求厂商提供"同配置、同软件栈"的实测参数承诺,而非仅亮点和纸面汇总
验收标准
按你真要跑的模型与并发,实测显存占用、卡间通信带宽、整机柜实际功耗,达标再签
机房前置
供货前完成机房电 / 冷 / 承重勘察,出具可承载证明,作为到货前提

这几条看着琐碎,但它们把"厂商话术"翻译成了"可验收的事实"。我交付过的政企项目里,凡是这几条写清楚的,后期扯皮少一大半;凡是只写"提供高性能 AI 服务器若干台"的,多半在验收时陷入"他说达标了、你说没感觉到"的泥潭。

一句话总结:一台 AI 服务器强不强,不看"卡数"看"组合"——显存装得下、互连跟得上、电源留余量、机柜喂得起,四条全中才是真能用的机器。

九、项目实际:不同规模单位,配置单看重点不一样

最后给你一个"对号入座"的视角。同样一张审阅清单,单位规模不同,你踩的坑不一样,该盯的重点也不一样。我按八年里服务过的几类客户,给你画三档:

单位规模
典型用法
配置单最该盯什么
小型(委办局/科室)
轻量推理、知识库问答、OCR
单台 1~2 张卡即可;重点看显存够不够跑目标模型 + 整机柜功耗别超现有机房;互连和网卡别为用不上的性能多花钱
中型(地市局/国企)
中大规模推理或行业模型微调
几台到十几台;重点看卡间互连方式(训练必须 NVLink 级)+ 网卡带宽 + 机柜电冷承重,往往要机房小改造,增容审批提前排
大型(省级/集团)
整机柜集群、持续训练
重点在整机柜功耗、供电增容、液冷可行性,以及下篇要讲的集群网络与调度平台预算;单台参数反而不是主要矛盾

我服务过的一个省级单位,第一版方案直接按"大型"配置整机柜集群,预算吓退领导。后来按上面三档重做:第一年只上中型档、跑推理和试点训练,机房小改即可承载,预算降一大截,团队还先练了手。第二年业务真起来,再平滑扩到大型档——钱花在刀刃上,也没卡审批。

所以别一上来就照最大配置买。先用"你单位真实要跑什么业务"反推规模档,再按那档的重点审配置单。五项清单通吃所有档,只是每档权重不同。这正好接下一篇:单台再强也有顶,真上规模时,瓶颈就从"单机配置"转移到"集群怎么连、怎么调度"——那又是另一本账了。

下一篇预告:《单机不够怎么办——GPU 集群与算力调度》——单台再强也有顶,政企真上规模得把几十上百张卡连成集群。可为什么"买回来 32 张卡,利用率只有 11%"?调度平台、运维职责这些"看不见的成本"怎么算?下篇拆。

想看技术深坑版,可移步《GPU 集群与 KV Cache》一文。

说明:文中所涉客户场景均为脱敏示意,不对应任何真实客户与未公开数据。文中 HBM、NVLink、PCIe、Chiplet、统一内存、CXL 等均为行业公开技术概念的方向性说明;具体某代产品的带宽、显存容量、功耗等数值,以各厂商官方规格书 / 选型手册为准。

本文为公众号「甲乙方AI说」系列 《政企 AI 项目算力通识》 第 3 篇。你下次看配置单,是先数"几张卡",还是先问"互连怎么连、显存够不够、机柜吃得消"?这俩问法,差着一笔真金白银。