夜雨聆风学习资料网

ARTICLE · 1126046

AI硬件的产业新趋势

AI硬件的产业新趋势

比算力的时代结束了,比“Token成本”的时代到来了

《薛定谔的AI研究院》09月发布

——一场关于“省钱”的芯片战争,和一个时代的终结

引子:科技变革,一个让高管睡不着觉的问题  

凌晨两点,某大模型公司的CTO盯着屏幕上的账单发呆。

这个月的推理成本又超预算了。3000万美元。光是电费,就够在北京买一套房。

他手下有200个工程师,每天都在优化模型、剪枝、量化、蒸馏。效果是有,但杯水车薪。真正的成本大头,根本不在这。

他忍不住想起三年前的那个夏天。

那时他还是个研究员,在实验室里训练BERT模型。一台A100跑三天,电费几百块。老板拍着他的肩膀说:“好好干,AI的未来靠你了。”

那时候所有人都以为,AI的成本瓶颈是“训练太贵”。

直到GPT-3横空出世,ChatGPT引爆全球。一夜之间,全世界都在用AI。

训练一次模型确实贵,几千万美元。但你只需要训练一次。

推理呢?每一次对话,每一段文案,每一张图片——都在烧钱。

训练是买一把锤子,贵但只用一次。推理是你用这把锤子敲下的每一颗钉子。钉子多了,锤子的价格反而成了小头。

这位CTO终于明白了一件事:

AI的商业化,根本不是“算力够不够”的问题,而是“Token成本能不能降到白菜价”的问题。

而他不知道的是,就在他失眠的这个夜晚,一场席卷整个芯片行业的战争,已经进入了最惨烈的阶段。

这场战争的胜负,将决定未来十年AI的格局。

第一部分:四场完全不同的战争

让我们先把镜头拉远,看看整个芯片战场的地形。

大多数人提到“AI芯片”,脑子里只有一个模糊的概念:英伟达的GPU。

但真相是,AI芯片领域有四场完全不同的战争,每一场的规则都不一样。

第一场战争:训练芯片之战

这是最性感、最吸睛的战场。

核心指标只有一个:峰值算力,FLOPS。

参战者追逐的是“我的芯片每秒能算多少次”。为了这个数字,他们不惜砸下几十亿美元,堆算力、堆显存、堆集群互联。

这是一场“军备竞赛”。赢了,你就能训练下一代大模型。输了,你就出局。

但问题是,这个市场总共也没多大。全球能玩得起千亿参数训练的玩家,一只手数得过来。

第二场战争:云端推理芯片之战——本文主角

这才是真正的大市场。

核心指标变成了三个:每美元产出多少Token、每瓦电产出多少Token、用户等多久才能看到第一个字。

这不是一场“谁算得快”的比赛,而是一场“谁会省钱”的比赛。

训练芯片像奥运会百米冲刺,追求极限速度。推理芯片像开出租车公司,追求每公里的利润最大化。

第三场战争:端侧推理芯片之战

这是手机、耳机、眼镜里的芯片。

核心指标是功耗、面积、单价。你不能让手机发烫,不能让眼镜太重,不能让手表一天充三次电。

这里的玩家是高通、联发科、苹果。他们打的是一场“毫米波战争”——每一个平方毫米的芯片面积,每一毫瓦的功耗,都要锱铢必较。

第四场战争:通用AI芯片之战

这是英伟达的老本行。

核心指标是兼容性和生态覆盖度。什么都能跑,什么模型都能适配。

代价是什么?专项性能永远比不上专用芯片。

就像瑞士军刀,什么都能干,但切菜不如菜刀,拧螺丝不如螺丝刀。

四场战争中,只有一场决定了AI的未来。

训练芯片的市场在萎缩——模型越来越成熟,不需要天天训练新模型。

端侧芯片很重要,但那是消费电子的事情。

通用芯片正在被侵蚀——当推理成为主流,通用性不再是优势,反而是负担。

云端推理芯片,才是AI商业化真正的咽喉。

因为AI的未来,不是“训练一次模型”,而是无穷无尽的Token生成。

每一次对话、每一次搜索、每一次代码补全——都是一笔账单。

谁能把这张账单变得足够小,谁就能赢得AI的未来。

学生版:想象四种交通工具。

高铁追求极速,不计成本——这是训练芯片。

出租车追求每公里赚多少钱,既要快又要省油——这是云端推理芯片。

共享单车追求轻便便宜——这是端侧芯片。

家用SUV什么路都能走,但油耗比不过摩托车——这是通用芯片。

你不可能用同一辆车解决所有出行需求。芯片也是一样。

第二部分:四个互不相让的维度

假设你在硅谷,现在是一名芯片设计师。老板给了你一个任务:设计一颗云端推理芯片。

你问老板:“有什么要求?”

老板想了想说:“要快,要便宜,要省电,还要什么模型都能跑。”

你笑了。

这四个要求,就像让一个运动员同时拿奥运金牌、省吃俭用、睡最少觉、还能参加所有项目。

它们互相矛盾,互不相让。

第一个维度:成本。

每一枚Token的生产成本。贵的芯片可以很快,但快不等于划算。

云端推理是规模化生意。百万级、亿级Token累加,微小的成本差距,就是企业盈亏的分水岭。

想象一下:你每卖出一杯咖啡,利润是两块钱。如果有一天,咖啡机的折旧成本涨了五分钱——一年下来,就是十几万的损失。

Token的生意,比咖啡还薄。

第二个维度:速度。

速度不只是用户感知的快慢。

更核心的是:同等时间内,模型能完成多少内部思考、实验、推理迭代。

Agent时代,模型需要自己思考、计划、试错。如果速度不够,它还没想清楚,用户已经不耐烦了。

速度直接决定AI的智能上限。

第三个维度:能耗(用电量)

这里有一个有趣的差异。

美国的数据中心,电费占了运营成本的三分之二。所以他们拼命优化“每瓦Token产出”。

中国的数据中心,设备折旧和供应链成本更高。所以他们优先优化“每美元Token产出”。

同样的芯片,在美国和省电,在中国和省钱。电费和硬件折旧,是两套完全独立的成本体系。

第四个维度:通用性。

专用芯片性价比拉满,但模型一变,它就废了。

通用芯片什么都能跑,但每一项性能都不是最优。

这是一个永恒的trade-off。

训练时代,你只需要一个指标:FLOPS。

推理时代,你必须同时面对四个互相矛盾的维度。

没有完美的芯片,只有在约束下的最优解。

学生版:

训练芯片像竞速比赛,只看发动机就够了。

推理芯片像开餐馆。你要同时考虑食材成本、出餐速度、电费煤气费,以及能不能做川菜粤菜西餐。

只做好一道菜的餐馆活不长,什么都做的餐馆可能每道菜都不好吃。

真正的赢家,是在这四个维度中找到最适合自己客群的平衡点。

第三部分 最大瓶颈:不是算不动而是搬不动

现在,让我们走进芯片的内部,看看推理到底卡在哪里。

大多数人以为:推理慢,是因为算力不够? 还真不是。

真相是:推理的时候,计算单元大部分时间都在闲置。

它们在等数据。

让我们回到那个大厨房。

厨师们个个都是米其林三星,刀工精湛,火候精准。切菜、翻炒、装盘,一气呵成。

但食材存放在地下室的冷库里。

每次做一道菜,厨师都得派帮厨跑到地下室去搬食材。

帮厨在楼梯上跑来跑去,气喘吁吁。厨师在灶台前干等着,锅都快烧红了。

大部分时间,最值钱的厨师在等最不值钱的帮厨。

这就是推理芯片的困境。

训练和推理的区别,就在这里。

训练的时候,你一次性把十吨食材搬到厨房备好。然后集中烹饪,连续做一百道菜。搬一次,用很久。

推理的时候,客人点一道菜,你去地下室拿一份食材。做完,再点下一道,你再跑一趟。

每一次推理,都是一次“跑楼梯”。

而跑楼梯才是真正的成本大头。

斯坦福芯片泰斗英伟达首席科学家Bill Dally的名言:

“计算不费电,搬数据才费电。计算不是瓶颈,数据移动是终极瓶颈。”(HBM)

这句话,是整个芯片架构设计的基石。

不同阶段的推理,瓶颈也不同。

Prefill阶段——模型第一次看到你的输入,需要计算所有的中间状态。这时候算力是瓶颈。你需要GPU那种大规模并行计算。

Decode阶段——模型一个字一个字地往外蹦。这时候带宽是瓶颈。你需要把模型权重从内存搬到计算单元,越快越好。SRAM近存架构更适合。

长上下文和Agent场景——模型需要记住很多历史信息。这时候存储容量是瓶颈。你需要HBM或者分层存储。

多卡集群扩展——一张卡不够,需要多张卡一起干活。这时候通信是瓶颈。你需要晶圆级集成或者高速互联。

没有一个架构能同时解决所有瓶颈。

这就是为什么,未来的推理芯片不会是“一颗通吃”。

学生版:想象一个大厨房。

训练相当于一次性把十吨食材搬到厨房备好,然后集中烹饪。搬一次就行。

推理相当于客人点一道菜,你去地下室拿一份食材,做完再点下一道,你再跑一趟。反复跑楼梯才是真正的成本大头。

所以最好的解决方案是:在厨师手边建一个小冰箱,把最常用的食材放进去。

这就是专用推理芯片的设计思路。

第四部分:五条技术路线的不同的取舍

既然没有完美的芯片,那市面上的玩家都在做什么?

答案是:他们在走不同的路,每条路都有自己的取舍。

没有一条路是“正确”的,也没有一条路是“错误”的。只有“适合”与“不适合”。

路线A:HBM通用GPU路线

代表:英伟达Blackwell、Rubin。

这条路的核心策略是:超大算力 + HBM高带宽 + CUDA生态。

这是英伟达的老本行。通用性强,生态完善,什么模型都能跑。

但代价是什么?

带宽性价比极低。Decode阶段,算力大量闲置。你花了100%的钱买了算力,实际只用了30%。

就像一个五星级大厨,大部分时间在等食材送上来。

路线B:片上SRAM + 静态调度路线

代表:Groq LPU。

这条路的核心策略是:模型权重常驻片上SRAM,编译器提前排布所有数据流。

结果是:延迟极致拉低,带宽性价比碾压GPU。

但代价是什么?

芯片容量有限。MoE动态模型跑不了,超长上下文适配不了。

就像地铁,准时高效,但修不了新线路。

路线C:晶圆级大芯片路线

代表:Cerebras WSE。

这条路的核心策略是:整片晶圆集成海量计算核与SRAM,消除芯片间物理距离。

结果是:理论带宽天花板极高。

但代价是什么?

良率、散热、制造成本爆炸。系统落地难度极大。

就像航空母舰,运力恐怖,但建造成本和维护费用也是天价。

路线D:分层存储可重构路线

代表:SambaNova、d-Matrix、TPU部分架构。

这条路的核心策略是:SRAM + HBM + DDR多级分层存储,软硬协同重构数据流。

结果是:比GPU成本更低,比纯SRAM芯片更通用。

但代价是什么?

软件栈复杂度指数级上升。

就像公交车加地铁加共享单车的组合,灵活省钱,但换乘麻烦。

路线E:芯片内异构通用路线

代表:OpenAI自研推理芯片、大厂自用芯片。

这条路的核心策略是:单芯片集成Prefill、Decode、Attention全模块,通过暗硅技术动态开关单元。

结果是:电力转化效率极致最优,适配多样模型。

但代价是什么?

单芯片Token成本并非行业最优。

就像混动车,市区用电、高速用油,效率高但造价贵。

成熟的行业认知是:没有最强芯片,只有最适配场景的芯片。

不问“谁更强”,只问“谁更适配当前workload”。

学生版:五种路线,好比五种交通工具。

路线A是全能越野车,能上山能下河,但油耗最高。

路线B是城市地铁,准时高效,但修不了新线路。

路线C是航空母舰,运力恐怖,但建造成本和维护费用天价。

路线D是公交车加地铁加共享单车的组合,灵活省钱,但换乘麻烦。

路线E是混动车,市区用电、高速用油,效率高但造价贵。

没有哪种交通工具是“最好”的,只有“最适合你今天的行程”的。

第五部分  CUDA的黄昏 生态不再是护城河

过去十年,CUDA是AI行业最坚固的壁垒。

它像一个巨大的磁铁,把所有开发者、所有模型、所有工具都吸附在自己身上。

你想换芯片?对不起,你得把整个软件栈重写一遍。

这就是CUDA的护城河:迁移成本高到让人绝望。

但这条护城河,正在被填平。原因有三。

第一,用户的需求变了。

训练用户需要CUDA。他们需要成熟生态、海量算子库、低迁移成本。CUDA无可替代。

但推理用户呢?他们的核心诉求只有两个:便宜,快速。

他们不在乎底层跑的是什么软件栈。只要便宜、好用,他们随时可以换。

第二,编译工具成熟了。

过去,换芯片等于重写模型。现在,有了PyTorch编译体系、Triton跨平台算子链,上层开发框架完成了硬件抽象隔离。

换芯片,不再需要重写模型。只需要替换后端调度与内存布局。

就像微信小程序:你在苹果上开发一次,安卓、网页、平板都能直接用。

第三,头部模型厂必然自建。

OpenAI、Google、Meta,这些公司都有足够的工程能力。

为了极致的成本可控、性能可控,他们一定会自建编译器、运行时与调度体系。

他们不会把自己的命运交在一家芯片公司手里。

核心趋势已经确定:

训练端,CUDA依旧稳坐王座。

推理端,CUDA壁垒持续崩塌。

未来AI Infra的核心壁垒,不再是软件生态,而是系统级Token成本优化能力。

当编译工具打破了CUDA的“应用壁垒”,用户就开始比真本事了:谁的Token更便宜、更快、更省电。

CUDA“一栈通吃”的时代,彻底结束了。

学生版:

想象你一直用苹果手机,App Store里有几千个应用。换安卓手机就意味着所有App都得重新下载,甚至有些根本没有安卓版。这就是CUDA的生态锁定。

但现在出现了“跨平台编译器”,就像微信小程序一样。你在苹果上开发一次,安卓、网页、平板都能直接用。

这时候,你还会因为“应用多”而死守苹果吗?

不会。你会开始比较:哪个手机拍照更好、电池更耐用、价格更便宜。

推理赛道就是这样。当编译工具打破了CUDA的“应用壁垒”,用户就开始比真本事了:谁的Token更便宜、更快、更省电。

第六部分  第一性原理——回到原点

最后,让我们回到一切的原点。

Bill Dally的四条原则,是整个芯片架构设计的基石。

第一,计算从来不是瓶颈,数据移动才是。

别纠结“算得快不快”,先解决“数据搬得近不近”。

第二,可静态预测的流程,编译器可以完胜硬件。

如果流程是固定的,让软件提前规划好路线,比临时反应更快。

第三,动态不确定的模型,必须依靠异构与可重构架构。

如果流程是不确定的,那就得准备多个备选方案。

第四,想要数量级的性能突破,必须跳出局部最优,主动取舍牺牲。

想要十倍提升,就别想着在原路上小修小补。得换一条路走。

云端推理芯片竞争的终极本质是:

在算力、带宽、容量、通信、能耗、通用性的互斥约束下,

结合电力、成本、模型、供应链的外部市场规则,

寻找全局最优的系统级Pareto解。

未来的行业公式已然清晰:

推理芯片 = 以Token为货币、以局部性为核心、以异构系统为产品的AI基础设施。

算力内卷的时代落幕,Token成本为王的时代,正式开启。

尾声:故事才刚刚开始

还记得开头那位失眠的CTO吗?

三个月后,他的团队完成了一次架构升级。

他们把推理集群从纯GPU换成了GPU加SRAM专用芯片的异构系统。

结果是:Token成本下降了60%,电费下降了45%,用户响应速度提升了2倍。

他终于在凌晨两点睡着了。

但他知道,这只是开始。

芯片战争还在继续。新的架构、新的材料、新的编译器,每天都在涌现。

而这一切的背后,只有一个简单的驱动力:

人类对智能的渴望是无限的,这场战争,没有终点线。只有不断的迭代和进化。

谁能把Token成本降到足够低,谁就能让AI真正走进千家万户。

而我们,正站在这场变革的起点。

《薛定谔的AI研究院》09月发布

AI产业趋势对硬件市场规模的变化预测

硬件替代:通用GPU → 专用ASIC异构系统

价值重心:计算芯片 → HBM存储+高速互联+散热电力系统

一 训练芯片(数据中心训练加速器)

2025年全球市场规模278.4亿美元,2030年预计892.6亿美元,五年复合增速CAGR 26.3%。

中国市场2025年89.7亿美元,占全球32.2%。

结构性核心变化:

模型底座成熟、迭代趋稳,一次性大额训练投入递减,AI资本开支主力彻底从训练转向推理。

早期高爆发时代结束,训练芯片由“AI核心增量”变为“存量稳态市场”。

二 云端推理芯片(AI未来第一主战场·核心增量)

多权威口径交叉收敛,为当前AI硬件增速最高、空间最大、确定性最强的核心赛道。

核心规模:

2025年全球云端推理芯片市场中枢1021亿美元,同比增速52.6%,增速是训练芯片两倍以上。

QYResearch 2025年499.5亿美元,2032年2802.8亿美元,CAGR 27.9%。

结构质变:

2023年推理算力仅占总算力33%,2026年反超至66%,2030年独占80%AI计算资源。

2026年是AI行业历史性拐点:推理硬件规模正式超越训练硬件。

整个赛道增长完全由全球Token生成总量、Agent自动化交互、长对话流量驱动,是未来五年AI硬件唯一超级大盘。

通用GPU推理份额持续被替代:

2023年通用GPU承载90%云端推理负载,2026年降至72%,2030年跌至55%,通用芯片推理溢价持续瓦解。

专用/异构推理芯片(SRAM近存、晶圆级、可重构、分层存储ASIC):

2025年63亿美元,2030年471亿美元,CAGR 30.2%,全硬件赛道增速第一。

行业彻底告别“单卡通吃”,低延迟、超大上下文、高吞吐场景各自被专属架构瓜分。

三 端侧推理芯片(高出货、低单值、海量渗透)

端侧AI芯片呈现出货爆炸、单颗价值微薄、渗透率快速抬升特征。

2025年全球端侧AI推理芯片规模中枢127–178亿美元,同比增速34%–47.9%。

全年芯片出货量12.3亿颗(高口径)/9.8亿颗(保守口径)。

智能手机、IoT、穿戴设备AI渗透率已达41%,较2023年提升18个百分点。

人民币口径对照:2025年约1800亿元,2028年突破3000亿元。

核心特征:

终端设备数量无穷扩张,但受功耗、面积、成本约束,单芯片ASP仅1–10美元。

整体市场体量远小于云端推理,属于“量大利薄”赛道。

四 HBM存储(AI硬件价值最大迁移方向)

AI瓶颈彻底从计算不足转向数据搬运不足,HBM成为AI硬件结构性最大赢家。

权威口径:

2025年HBM市场88.8亿美元,2026年125.6亿美元,2031年468.2亿美元,CAGR 30.1%。

供需爆发:

2025年HBM总需求2678单位,2026年4709单位,同比暴涨76%。

HBM在DRAM整体市场占比,由2024年5%跃升至2026年10%。

服务器BOM结构彻底重构:

2023年AI服务器:计算芯片62%、存储22%;

2030年AI服务器:计算芯片44%、存储+互联41%。

存储价值权重几乎追平计算芯片。

叠加AI-SRAM、高速SerDes、片间互联硬件:

2025年98亿美元,2030年276亿美元,持续高增。

五 数据中心配套硬件(电力·散热·组网·调度)

AI竞争进入系统级成本优化时代,配套基础设施价值重估。

全球数据中心整体市场:

2025年2356.5亿美元,2034年4817.3亿美元,CAGR 11.4%。

AI冷却/液冷高景气细分:

全球冷却市场:2025年187.8亿美元,2032年424.8亿美元,CAGR 12.4%。

全球散热大盘:2025年263亿美元,2033年1283亿美元,8年翻5倍。

行业逻辑彻底切换:

从“堆GPU算力”,升级为整机柜Token成本、PUE、散热效率、集群调度效率的系统竞争。

六 自研推理ASIC(GPU最强替代·结构性颠覆)

定制AI ASIC是未来两年AI硬件最强替代变量,增速碾压通用GPU。

市场规模:

2026年全球定制AI ASIC规模600–700亿美元,行业复合增速40%–50%。

结构替代量化:

2026年ASIC加速器出货770万片,占AI加速器总出货45%;2027年ASIC份额反超GPU,达到58%。

增速对比:

ASIC年增速44.6%,是商用GPU增速(16.1%)的近3倍。头部云厂商、模型公司全面去GPU化,通过自研芯片+自研编译器+自研运行时实现Token成本极致下压。

《薛定谔的AI研究院》 历史文章分类

第一类 AI硬件和软件的破局者

《DeepSeek推动AI产业再进化》

《DeepSeek的下半场 逆转产业趋势》

第二类 产业落地路径

《AI产业困境与“奶头乐”战略出路》

《十大科技原创预测》

《机器人产业化五种形态》

第三类 技术范式革命

《DS4 vs 分形大模型:关于AI未来的“改良与“创新》

《分形大模型:基于宇宙自相似结构的AI生成范式》

第四类 全球产业格局

《2027 东方崛起:「东器西算」》

《东器西算|算力范式彻底重构》

第五类 硬件底座与资本市场

《长鑫3万亿只是起点|国产算力集群全面国产化》

《不用疯狂堆GPU!用盖房子讲透AI大变局》

相关学习资料