写给甲方 IT 的硬科技白话课 · 本文为系列第 3 篇
前两篇我们聊了"算力三兄弟怎么选""信创靠不靠谱",有读者追着问:"道理我都懂,可厂商甩来的配置单,满篇 8 卡、HBM、NVLink、PCIe 6.0,我一个都看不懂,怎么知道他没坑我?"
同样,这篇从两个视角讲:基础知识视角拆零件、讲原理——HBM 显存、NVLink、PCIe、Chiplet、统一内存到底是什么;项目实际视角给清单、讲踩坑——配置单怎么审、整机柜怎么算电和冷、采购验收怎么写条款。读完你至少能自己看懂配置单上的关键五项,不再被"卡数"两个字牵着走。
一、基础知识:打开机箱,一台 AI 服务器里到底有什么
咱们先把一台 AI 服务器想成一台"特别能干的电脑"。普通电脑里有的,它都有;普通电脑没有的,它也得有。从外到内,主要零件就这几样:
CPU(中央处理器)
全能管家,管调度和通用活
负责系统启动、任务分配、数据预处理、和外面网络通信 AI 服务器里 CPU 核心数往往很多(几十到上百核),为的是"喂得饱"下面的加速卡
加速卡(GPU / NPU)
真正干 AI 重活的"搬砖大队"
一块卡上除了计算单元,还自带一块"手边显存"(HBM) 一台机器能插多张,卡与卡之间要靠"互连"连起来协同
内存(DDR)
CPU 这边的大仓库
给 CPU 干活用的普通内存,容量大、但速度比显存慢
网卡(高速网卡)
机器对外的高速出口
单机多卡还不够,多台机器组网才成集群,网卡带宽决定"对外吞吐"
SSD(固态硬盘)/ 电源 / 主板
存储、供电、骨架
主板上的 PCIe 总线,是把 CPU、卡、网卡"串起来"的高速公路 电源要扛住全部零件的总功耗,余量不够会宕机
记住这个画面,后面每讲一个名词,你都能在机箱里给它找个位置。对甲方来说,真正决定这台机器"强不强、贵不贵、机房喂不喂得起"的,往往不是最显眼的"卡数",而是卡旁边的显存、卡之间的互连、以及整机柜的功耗——这正是厂商最爱模糊处理的地方。
二、基础知识:显存(HBM)——决定你能跑多大模型的那块"手边货架"
先讲显存,因为它最容易让甲方栽跟头。很多人挑机器只看"算力多少 TFLOPS",但真跑起大模型,第一个撞上的天花板往往是显存,不是算力。
白话解释:显存是 GPU/NPU 手边的高档货架。模型参数、中间计算结果,都得临时放在这块离计算单元最近的货架上,随用随取。货架太小,大模型根本摊不开——就像你想在厨房做满汉全席,灶台火力再猛,案板只有巴掌大,菜也摆不下。这就是为什么"7B 小模型一台卡能跑、70B 大模型得把几张卡显存拼起来才装得下":不是算力不够,是货架不够。
那 HBM 是什么?它是显存的一种高端形态——高带宽内存,用 3D 堆叠工艺把多层存储颗粒直接摞在芯片旁边,带宽远高于普通 DDR,但容量相对小、成本高。所以你常看到"这台机器单卡显存 80GB、整机上 TB 级"——这个"80GB"决定它能塞下多大的模型,"上 TB"决定它能塞下多大的多卡协同任务。反过来,如果一台机器卡很多、但单卡显存小,跑大模型照样吃力。
甲方决策点:先看你要跑的模型参数量,反推需要多少显存,再选卡数和单卡显存。别被"总算力"晃花了眼——显存不够,算力再高也是英雄无用武之地。具体某模型在某卡上的显存占用与可行部署方式,以模型官方部署文档 / 厂商实测为准,本文不杜撰数字。
三、基础知识:卡间互连——NVLink vs PCIe,为什么"8 卡"有快有慢
这是上篇那个"8 卡旗舰"坑的真相所在。一台机器插了 8 张卡,它们要协同干活,卡和卡之间得通信。通信的"路"有好坏之分,直接决定这 8 张卡是"真·8 卡合力",还是"8 张各干各的、偶尔通个信"。
- NVLink(一类高带宽卡间互连):卡间的"高速班车专线"。
专为多卡协同设计,点对点带宽极高、延迟极低,8 张卡像坐专线班车,数据嗖嗖地互相传。跑大模型训练、多卡推理时,卡间要频繁交换大量中间结果,专线的价值就出来了。 - PCIe(通用总线):卡间的"普通公路"。
它是电脑里通用的高速总线,啥都能接,但不是为多卡 AI 协同专门优化,带宽和延迟都比专线差一截。8 张卡走 PCIe 互联,相当于大家挤在一条普通公路上,车多就堵。
对甲方意味着什么?同样的"8 卡",NVLink 全互连版和 PCIe 桥接版,跑大模型训练时有效性能能差出一大截,价格也差出一大截。厂商如果拿 PCIe 方案按 NVLink 的价格卖,你就亏了;反之,如果你单位主要是轻量推理、卡间通信不多,PCIe 方案也许够用、还省钱——关键是你得知道自己要的是哪种。所以看配置单,"卡间互连方式"必须写清楚,不能只写"8 卡"。
这里插一句基础知识:互连带宽的单位常是 GB/s(每秒传输的字节数),延迟单位常是纳秒级。具体某代 NVLink 或 PCIe 的带宽数值,以厂商官方规格书为准,不同代际差异很大,本文不替你背具体数字——你只要死死记住"专线比公路快、买前问清互连方式"这条原则。
一句话避坑:配置单上只写"8 卡 / 16 卡"却不说互连方式,一律当作信号——要么他也不懂,要么他不想让你懂。两种都得追问。
四、基础知识:Chiplet 与先进封装——芯片为什么像拼乐高
下一个常被厂商拿来唬人的词是"先进封装""Chiplet"。说人话:传统芯片是在一整块硅片上刻出所有电路,越大越难造、良率越低。Chiplet 的思路是——把大芯片拆成几个小芯片(芯粒),再用先进封装像拼乐高一样拼回一个大芯片。每个小芯粒可以单独设计、单独制造,拼起来整体性能更强、成本更可控、也能把不同工艺的零件组合在一起。
对甲方有什么用?两点:第一,它解释了为什么"同样叫 GPU,里面构造可能完全不同"——有的是单片大核,有的是多芯粒拼接,背后是不同厂商的路线选择;第二,它和你单位的供应链与自主可控直接相关(呼应第 2 篇信创)——芯粒拆分后,单一环节的受制面更小,国产化路径更灵活。但注意,Chiplet 是制造端的工艺路线,不改变你选型时该看的"算力、显存、互连、功耗"四项,它只是底层为什么能做到这些性能的原因之一。别让厂商拿"我们用了先进封装"当卖点模糊掉真正该比的参数。
五、基础知识:统一内存与 CXL——CPU 和 GPU 之间的"内存墙"
最后补一个偏底层、但正在变重要的概念:CPU 的内存(DDR)和 GPU 的显存(HBM),传统上是两堵"墙"——数据要从 CPU 那边搬到 GPU 这边,得专门拷贝一次,慢且占带宽。"统一内存"就是想办法让 CPU 和 GPU 看到同一块内存地址,不用来回搬;CXL 是一类新的互连标准,目标是让 CPU、GPU、各种加速器能更高效地共享内存、扩展内存容量。
对甲方的现实意义:如果你的业务是"CPU 预处理 → GPU 推理"这种频繁来回搬数据的场景,统一内存 / CXL 类的支持能明显减少搬运开销、提升整体效率。但它目前仍是演进中的技术,不同平台支持程度不一。选型时把它当作"加分项核实",而不是决定项——先确认你的软件栈和框架是否真的用得上,别为用不上的前沿特性多花钱。具体支持情况以厂商平台规格与软件版本为准。
六、项目实际:配置单甲方审阅清单(必看 5 项)
讲完零件,落到你最该会的本事——看配置单。我把八年里反复用的一张《配置单甲方审阅清单》交给你,五项是必看,少一项都别签字:
上表为审阅框架,不绑定任何厂商型号。具体某型号的互连带宽、显存容量、功耗数值,以厂商官方规格书 / 选型手册为准,本文不杜撰具体数字。审阅时建议要求厂商逐项为每台机器出具书面参数,而非只给汇总"亮点"。
三个真实踩坑(均为脱敏示意)
- 坑一:"卡数"障眼法。
某项目报"8 卡旗舰",实际 PCIe 桥接、单卡显存偏小。我们按上面清单一核,跑客户目标模型显存不够,当场要求换方案或调价,省下近一辆车的钱(示意量级)。 - 坑二:电源无余量。
配置单总功耗标得刚好卡在电源额定值,没留冗余。后期加一块卡就超,只能整机换电源,工期拖半个月。 - 坑三:网卡成瓶颈。
机器算力强、但网卡带宽低,多机一组网,对外吞吐卡在网卡上,集群白建了一半。这正好是下一篇"GPU 集群"要展开的话题。
七、项目实际:别只看单机,整机柜才决定机房的电和冷
这是甲方最容易算漏的一笔账。一台 AI 服务器的"单机参数"好看,不等于"放进机房就好养"。真正决定项目能不能落地的,是它占的整机柜视角:电、冷、承重。
白话讲:AI 服务器是出了名的"电老虎 + 发热怪"。一台高配机器功耗可能顶普通服务器好几台;一个机柜塞几台,整柜功耗就是几十千瓦量级。这带来三个硬约束:
- 供电:
机房这路电能不能扛住整柜功耗?要不要增容、走专用回路?增容审批周期常常以月计,不排进项目计划就会卡这儿(呼应第 10 篇要讲的供电账)。 - 散热:
这么多热量散不出去,机器会降频甚至宕机。风冷能不能压住、要不要上液冷,方案阶段就得定(第 9 篇专门讲)。 - 承重:
满配机柜很重,老机房楼板承重不够要加固,否则不安全。我见过项目货到了才发现楼板要加固、工期翻倍。
所以看配置单,第⑤项"整机柜功耗"不是可选项,是必选项。把单台功耗 × 机柜台数算出来,拿去和机房现有电、冷、承重三本账对一遍,对不上就别签——机器再强,机房喂不饱也是摆设。具体功耗与散热要求以设备规格书和机房勘察为准。
八、项目实际:采购与验收,这几条写进条款
最后给你落到合同层面的动作。基于上面所有点,采购文件和验收标准里,建议把这几条钉死:
这几条看着琐碎,但它们把"厂商话术"翻译成了"可验收的事实"。我交付过的政企项目里,凡是这几条写清楚的,后期扯皮少一大半;凡是只写"提供高性能 AI 服务器若干台"的,多半在验收时陷入"他说达标了、你说没感觉到"的泥潭。
一句话总结:一台 AI 服务器强不强,不看"卡数"看"组合"——显存装得下、互连跟得上、电源留余量、机柜喂得起,四条全中才是真能用的机器。
九、项目实际:不同规模单位,配置单看重点不一样
最后给你一个"对号入座"的视角。同样一张审阅清单,单位规模不同,你踩的坑不一样,该盯的重点也不一样。我按八年里服务过的几类客户,给你画三档:
我服务过的一个省级单位,第一版方案直接按"大型"配置整机柜集群,预算吓退领导。后来按上面三档重做:第一年只上中型档、跑推理和试点训练,机房小改即可承载,预算降一大截,团队还先练了手。第二年业务真起来,再平滑扩到大型档——钱花在刀刃上,也没卡审批。
所以别一上来就照最大配置买。先用"你单位真实要跑什么业务"反推规模档,再按那档的重点审配置单。五项清单通吃所有档,只是每档权重不同。这正好接下一篇:单台再强也有顶,真上规模时,瓶颈就从"单机配置"转移到"集群怎么连、怎么调度"——那又是另一本账了。
下一篇预告:《单机不够怎么办——GPU 集群与算力调度》——单台再强也有顶,政企真上规模得把几十上百张卡连成集群。可为什么"买回来 32 张卡,利用率只有 11%"?调度平台、运维职责这些"看不见的成本"怎么算?下篇拆。
想看技术深坑版,可移步《GPU 集群与 KV Cache》一文。
说明:文中所涉客户场景均为脱敏示意,不对应任何真实客户与未公开数据。文中 HBM、NVLink、PCIe、Chiplet、统一内存、CXL 等均为行业公开技术概念的方向性说明;具体某代产品的带宽、显存容量、功耗等数值,以各厂商官方规格书 / 选型手册为准。
本文为公众号「甲乙方AI说」系列 《政企 AI 项目算力通识》 第 3 篇。你下次看配置单,是先数"几张卡",还是先问"互连怎么连、显存够不够、机柜吃得消"?这俩问法,差着一笔真金白银。
夜雨聆风