2026 年世界人工智能大会之后,AI 圈最热的词变了。不再是"谁的模型更强",而是"谁的算力系统能稳定地吐出 Token"。国家宣布"十五五"期间算力网建设新增直接投资约 4 万亿元,华为亮出可扩展到 50 万卡的集群方案,中科曙光建成全国产十万卡超集群。
AI 的竞争,正在从"模型层"沉到"基础设施层"。这篇文章把 AI 基础设施(AI Infra)拆开讲清楚:它是什么、分几层、正在发生什么。
一、AI infra 到底是什么
把 AI 比作汽车,那 AI 基础设施就是"路 + 电厂 + 加油站"的组合——没有它,模型再强也跑不起来。
它的范围很广,从下往上大致四层:
硬件层:AI 芯片(GPU/NPU)、内存(HBM)、芯片互联 集群层:服务器、数据中心、超节点、万卡集群 软件层:训练框架、推理引擎、算力调度 服务层:云平台(算力出租)、MLOps(模型部署与运维)
模型决定 AI 的上限,基础设施决定它的下限和成本。同样是 GPT 级别的模型,有人跑一个 Token 要几分钱,有人只要几厘——差距全在基础设施上。

二、硬件层:芯片和那"两堵墙"
硬件层是整条链的物理底座,里面有三个角色,各管一摊:
AI 芯片——算力之源。它负责所有训练和推理的计算,相当于模型的"大脑"。海外英伟达一家独大(最新 Blackwell 系列市占率超过七成),国产华为昇腾、寒武纪、海光、沐曦正在追赶。 HBM 内存——超高带宽的"临时仓库"。芯片算得快,数据喂不上来就会干等,HBM 负责把数据及时喂给芯片。 芯片互联——卡与卡之间的"高速公路"。单卡再快,数据搬不过去也白搭,互联的水平决定多张卡协作的效率。
硬件层的主角是 AI 芯片,但它不是孤军奋战——算力、存力、互联,三者缺一不可。
而这几年硬件层最大的新闻,不是某颗芯片多快,而是两堵"墙":
2024—2025 年,瓶颈是"内存墙"。 单张显卡的显存放不下万亿参数模型的全部参数,数据只能在显卡和内存之间来回搬运,搬运本身拖慢了计算。
2026 年,瓶颈转移到了"互联墙"。 模型越来越大,动辄需要上千张卡协同计算。有个通俗的比喻:上千人合写一本大部头,每写一句就要全员同步一次——就算每个人计算能力拉满,等待同步的时间也吃掉了大半算力。传统 8 卡服务器在规模化集群里,算力利用率常常不到五成。大量显卡不是在算,是在等。所以单靠堆芯片,很容易有瓶颈,这样就需要集群层介入。
三、集群层:超节点与万卡集群
集群层解决的是"数量"的问题:一张卡不够,就把很多张卡组织起来。它的演进是一个不断放大的过程:
服务器——最小单元。一台机器装若干张卡(常见 8 卡),单机内先协同; 数据中心——"大厂房"。成千上万台服务器堆在一起,还得额外解决散热、供电、网络这些"苦活"; 超节点 / 万卡集群——"焊"成一个整体。用高速电、光互联把上千张卡封装进统一计算域,让它们协作起来像一颗巨型芯片。
前两层,其实是传统云计算时代就有的"机房";第三层,才是大模型时代真正的新东西。
应对"互联墙",行业给出的答案正是超节点——
这是 2026 年 AI 基建最热闹的地方:
华为:Atlas 950 SuperPoD 真机亮相——1024 张昇腾卡组成单一逻辑计算域,256TB 共享内存池,整机可扩展到 50 万卡规模。 中科曙光:建成国内首个全国产十万卡 AI 超集群,每秒峰值算力相当于全人类持续计算 200 年。 壁仞、沐曦、摩尔线程、燧原:各家超节点方案集中亮相。
行业把今年称为"国产超节点元年",有券商测算 2028 年国内超节点市场规模将突破 3400 亿、三年复合增速近 200%。背后的逻辑是:算力竞争从"单卡跑分"切换到了"系统交付"——客户问的不再是"你有多少张卡",而是"Token 成本多少、响应快不快、系统稳不稳"。
四、软件层与服务层:从训练到推理再到交付
硬件之外,还有一层看不见的软件栈,负责把算力"用好":
训练框架:组织上千张卡协同训练一个大模型(如 PyTorch),解决"这么多卡怎么一起干活"的问题; 推理引擎:把训练好的模型部署上线,压低每次回答的延迟和成本(如 vLLM)——同样的模型,用不同推理引擎,成本能差好几倍; 算力调度:把分散的算力池化、按需分配,像电网调度一样——国内正在建"全国算力一张网"(东数西算工程 + 深圳到贵州的千公里光直连大通道"深贵线"),让算力跨地域流动。
再往上一层,是服务层——把算力和模型管理变成按需可用的服务:
云平台:把算力出租出去,按小时或按 Token 计费(AWS、阿里云等)。绝大多数公司用 AI,不是自己买卡,而是租云; MLOps:管模型的一生——部署、升级、监控、回滚。模型上线之后谁来运维,靠的就是它; 数据管道:负责清洗、标注、合成数据,喂给模型训练——没有数据,模型再大也没东西可学。
从芯片到云平台,这四层一层托一层:硬件层给算力,集群层组织算力,软件层调度算力,服务层交付算力。
一个正在发生的趋势值得注意:推理正在超过训练,成为算力需求的主要来源。 Gartner 预测到 2028 年,超过七成企业的 AI 工作负载会跑在"云端 + 本地"的混合算力上。也就是说,未来算力的比拼重点,是"怎么用最少的钱把模型服务给用户",而不是"怎么把模型训出来"。
五、为什么普通人也要关心
AI 基础设施听起来离普通人很远,但它正在决定三件和你有关的事:
第一,你用的 AI 产品贵不贵,取决于它。 每次对话消耗的 Token 都有成本,这个成本主要由基础设施效率决定。基础设施卷得越狠,AI 产品越便宜——DeepSeek 能把推理成本打到行业地板价,靠的就是把"系统效率"做到了极致。
第二, 万亿投资是时代钱流的方向。 算力网建设、数据中心、国产芯片,这些正在吸纳巨量资本和就业。跟对这条链的人,等于站在了未来十年的风口上。
第三,"国产替代"进入深水区。 从芯片(国产加速卡份额已超四成)到超节点、再到软件生态,国产基础设施正在从"能用"走向"好用"。这轮系统级的换道超车,可能是中国 AI 产业链最值得关注的变化。
模型是面子,基础设施是里子。2026 年,AI 行业正在把力气从面子挪到里子上——谁先把这套"水电煤"建好,谁就拿到下一轮竞争的门票。
参考:
[1] 腾讯新闻 2026-08-07《我国4万亿投资启幕》:算力网建设投资 4 万亿、IDC/Gartner 预测、推理将超训练成为算力主需求
[2] 芯流 WAIC 观察 2026-08-06《告别"单芯英雄主义"》:超节点革命、内存墙→互联墙、算力利用率不足五成
[3] 腾讯云开发者社区 2026:华为 Atlas 950 SuperPoD(1024 卡/50 万卡)、中科曙光全国产十万卡集群、国产超节点元年、2028 市场规模 3414 亿、2026 Q1 国内 AI 算力需求同比 +417%
[4] 央视网 2026-08-09:首个全国产十万卡超集群投用、全国智算规模同比增长 177%、"深贵线"光直连大通道
夜雨聆风