ARTICLE · 1126046
AI硬件的产业新趋势


AI硬件的产业新趋势
比算力的时代结束了,比“Token成本”的时代到来了
《薛定谔的AI研究院》09月发布
——一场关于“省钱”的芯片战争,和一个时代的终结
引子:科技变革,一个让高管睡不着觉的问题
凌晨两点,某大模型公司的CTO盯着屏幕上的账单发呆。
这个月的推理成本又超预算了。3000万美元。光是电费,就够在北京买一套房。
他手下有200个工程师,每天都在优化模型、剪枝、量化、蒸馏。效果是有,但杯水车薪。真正的成本大头,根本不在这。
他忍不住想起三年前的那个夏天。
那时他还是个研究员,在实验室里训练BERT模型。一台A100跑三天,电费几百块。老板拍着他的肩膀说:“好好干,AI的未来靠你了。”
那时候所有人都以为,AI的成本瓶颈是“训练太贵”。
直到GPT-3横空出世,ChatGPT引爆全球。一夜之间,全世界都在用AI。
训练一次模型确实贵,几千万美元。但你只需要训练一次。
推理呢?每一次对话,每一段文案,每一张图片——都在烧钱。
训练是买一把锤子,贵但只用一次。推理是你用这把锤子敲下的每一颗钉子。钉子多了,锤子的价格反而成了小头。
这位CTO终于明白了一件事:
AI的商业化,根本不是“算力够不够”的问题,而是“Token成本能不能降到白菜价”的问题。
而他不知道的是,就在他失眠的这个夜晚,一场席卷整个芯片行业的战争,已经进入了最惨烈的阶段。
这场战争的胜负,将决定未来十年AI的格局。
第一部分:四场完全不同的战争
让我们先把镜头拉远,看看整个芯片战场的地形。
大多数人提到“AI芯片”,脑子里只有一个模糊的概念:英伟达的GPU。
但真相是,AI芯片领域有四场完全不同的战争,每一场的规则都不一样。
第一场战争:训练芯片之战
这是最性感、最吸睛的战场。
核心指标只有一个:峰值算力,FLOPS。
参战者追逐的是“我的芯片每秒能算多少次”。为了这个数字,他们不惜砸下几十亿美元,堆算力、堆显存、堆集群互联。
这是一场“军备竞赛”。赢了,你就能训练下一代大模型。输了,你就出局。
但问题是,这个市场总共也没多大。全球能玩得起千亿参数训练的玩家,一只手数得过来。
第二场战争:云端推理芯片之战——本文主角
这才是真正的大市场。
核心指标变成了三个:每美元产出多少Token、每瓦电产出多少Token、用户等多久才能看到第一个字。
这不是一场“谁算得快”的比赛,而是一场“谁会省钱”的比赛。
训练芯片像奥运会百米冲刺,追求极限速度。推理芯片像开出租车公司,追求每公里的利润最大化。
第三场战争:端侧推理芯片之战
这是手机、耳机、眼镜里的芯片。
核心指标是功耗、面积、单价。你不能让手机发烫,不能让眼镜太重,不能让手表一天充三次电。
这里的玩家是高通、联发科、苹果。他们打的是一场“毫米波战争”——每一个平方毫米的芯片面积,每一毫瓦的功耗,都要锱铢必较。
第四场战争:通用AI芯片之战
这是英伟达的老本行。
核心指标是兼容性和生态覆盖度。什么都能跑,什么模型都能适配。
代价是什么?专项性能永远比不上专用芯片。
就像瑞士军刀,什么都能干,但切菜不如菜刀,拧螺丝不如螺丝刀。
四场战争中,只有一场决定了AI的未来。
训练芯片的市场在萎缩——模型越来越成熟,不需要天天训练新模型。
端侧芯片很重要,但那是消费电子的事情。
通用芯片正在被侵蚀——当推理成为主流,通用性不再是优势,反而是负担。
云端推理芯片,才是AI商业化真正的咽喉。
因为AI的未来,不是“训练一次模型”,而是无穷无尽的Token生成。
每一次对话、每一次搜索、每一次代码补全——都是一笔账单。
谁能把这张账单变得足够小,谁就能赢得AI的未来。
学生版:想象四种交通工具。
高铁追求极速,不计成本——这是训练芯片。
出租车追求每公里赚多少钱,既要快又要省油——这是云端推理芯片。
共享单车追求轻便便宜——这是端侧芯片。
家用SUV什么路都能走,但油耗比不过摩托车——这是通用芯片。
你不可能用同一辆车解决所有出行需求。芯片也是一样。
第二部分:四个互不相让的维度
假设你在硅谷,现在是一名芯片设计师。老板给了你一个任务:设计一颗云端推理芯片。
你问老板:“有什么要求?”
老板想了想说:“要快,要便宜,要省电,还要什么模型都能跑。”
你笑了。
这四个要求,就像让一个运动员同时拿奥运金牌、省吃俭用、睡最少觉、还能参加所有项目。
它们互相矛盾,互不相让。
第一个维度:成本。
每一枚Token的生产成本。贵的芯片可以很快,但快不等于划算。
云端推理是规模化生意。百万级、亿级Token累加,微小的成本差距,就是企业盈亏的分水岭。
想象一下:你每卖出一杯咖啡,利润是两块钱。如果有一天,咖啡机的折旧成本涨了五分钱——一年下来,就是十几万的损失。
Token的生意,比咖啡还薄。
第二个维度:速度。
速度不只是用户感知的快慢。
更核心的是:同等时间内,模型能完成多少内部思考、实验、推理迭代。
Agent时代,模型需要自己思考、计划、试错。如果速度不够,它还没想清楚,用户已经不耐烦了。
速度直接决定AI的智能上限。
第三个维度:能耗(用电量)
这里有一个有趣的差异。
美国的数据中心,电费占了运营成本的三分之二。所以他们拼命优化“每瓦Token产出”。
中国的数据中心,设备折旧和供应链成本更高。所以他们优先优化“每美元Token产出”。
同样的芯片,在美国和省电,在中国和省钱。电费和硬件折旧,是两套完全独立的成本体系。
第四个维度:通用性。
专用芯片性价比拉满,但模型一变,它就废了。
通用芯片什么都能跑,但每一项性能都不是最优。
这是一个永恒的trade-off。
训练时代,你只需要一个指标:FLOPS。
推理时代,你必须同时面对四个互相矛盾的维度。
没有完美的芯片,只有在约束下的最优解。
学生版:
训练芯片像竞速比赛,只看发动机就够了。
推理芯片像开餐馆。你要同时考虑食材成本、出餐速度、电费煤气费,以及能不能做川菜粤菜西餐。
只做好一道菜的餐馆活不长,什么都做的餐馆可能每道菜都不好吃。
真正的赢家,是在这四个维度中找到最适合自己客群的平衡点。
第三部分 最大瓶颈:不是算不动而是搬不动
现在,让我们走进芯片的内部,看看推理到底卡在哪里。
大多数人以为:推理慢,是因为算力不够? 还真不是。
真相是:推理的时候,计算单元大部分时间都在闲置。
它们在等数据。
让我们回到那个大厨房。
厨师们个个都是米其林三星,刀工精湛,火候精准。切菜、翻炒、装盘,一气呵成。
但食材存放在地下室的冷库里。
每次做一道菜,厨师都得派帮厨跑到地下室去搬食材。
帮厨在楼梯上跑来跑去,气喘吁吁。厨师在灶台前干等着,锅都快烧红了。
大部分时间,最值钱的厨师在等最不值钱的帮厨。
这就是推理芯片的困境。
训练和推理的区别,就在这里。
训练的时候,你一次性把十吨食材搬到厨房备好。然后集中烹饪,连续做一百道菜。搬一次,用很久。
推理的时候,客人点一道菜,你去地下室拿一份食材。做完,再点下一道,你再跑一趟。
每一次推理,都是一次“跑楼梯”。
而跑楼梯才是真正的成本大头。
斯坦福芯片泰斗英伟达首席科学家Bill Dally的名言:
“计算不费电,搬数据才费电。计算不是瓶颈,数据移动是终极瓶颈。”(HBM)
这句话,是整个芯片架构设计的基石。
不同阶段的推理,瓶颈也不同。
Prefill阶段——模型第一次看到你的输入,需要计算所有的中间状态。这时候算力是瓶颈。你需要GPU那种大规模并行计算。
Decode阶段——模型一个字一个字地往外蹦。这时候带宽是瓶颈。你需要把模型权重从内存搬到计算单元,越快越好。SRAM近存架构更适合。
长上下文和Agent场景——模型需要记住很多历史信息。这时候存储容量是瓶颈。你需要HBM或者分层存储。
多卡集群扩展——一张卡不够,需要多张卡一起干活。这时候通信是瓶颈。你需要晶圆级集成或者高速互联。
没有一个架构能同时解决所有瓶颈。
这就是为什么,未来的推理芯片不会是“一颗通吃”。
学生版:想象一个大厨房。
训练相当于一次性把十吨食材搬到厨房备好,然后集中烹饪。搬一次就行。
推理相当于客人点一道菜,你去地下室拿一份食材,做完再点下一道,你再跑一趟。反复跑楼梯才是真正的成本大头。
所以最好的解决方案是:在厨师手边建一个小冰箱,把最常用的食材放进去。
这就是专用推理芯片的设计思路。
第四部分:五条技术路线的不同的取舍
既然没有完美的芯片,那市面上的玩家都在做什么?
答案是:他们在走不同的路,每条路都有自己的取舍。
没有一条路是“正确”的,也没有一条路是“错误”的。只有“适合”与“不适合”。
路线A:HBM通用GPU路线
代表:英伟达Blackwell、Rubin。
这条路的核心策略是:超大算力 + HBM高带宽 + CUDA生态。
这是英伟达的老本行。通用性强,生态完善,什么模型都能跑。
但代价是什么?
带宽性价比极低。Decode阶段,算力大量闲置。你花了100%的钱买了算力,实际只用了30%。
就像一个五星级大厨,大部分时间在等食材送上来。
路线B:片上SRAM + 静态调度路线
代表:Groq LPU。
这条路的核心策略是:模型权重常驻片上SRAM,编译器提前排布所有数据流。
结果是:延迟极致拉低,带宽性价比碾压GPU。
但代价是什么?
芯片容量有限。MoE动态模型跑不了,超长上下文适配不了。
就像地铁,准时高效,但修不了新线路。
路线C:晶圆级大芯片路线
代表:Cerebras WSE。
这条路的核心策略是:整片晶圆集成海量计算核与SRAM,消除芯片间物理距离。
结果是:理论带宽天花板极高。
但代价是什么?
良率、散热、制造成本爆炸。系统落地难度极大。
就像航空母舰,运力恐怖,但建造成本和维护费用也是天价。
路线D:分层存储可重构路线
代表:SambaNova、d-Matrix、TPU部分架构。
这条路的核心策略是:SRAM + HBM + DDR多级分层存储,软硬协同重构数据流。
结果是:比GPU成本更低,比纯SRAM芯片更通用。
但代价是什么?
软件栈复杂度指数级上升。
就像公交车加地铁加共享单车的组合,灵活省钱,但换乘麻烦。
路线E:芯片内异构通用路线
代表:OpenAI自研推理芯片、大厂自用芯片。
这条路的核心策略是:单芯片集成Prefill、Decode、Attention全模块,通过暗硅技术动态开关单元。
结果是:电力转化效率极致最优,适配多样模型。
但代价是什么?
单芯片Token成本并非行业最优。
就像混动车,市区用电、高速用油,效率高但造价贵。
成熟的行业认知是:没有最强芯片,只有最适配场景的芯片。
不问“谁更强”,只问“谁更适配当前workload”。
学生版:五种路线,好比五种交通工具。
路线A是全能越野车,能上山能下河,但油耗最高。
路线B是城市地铁,准时高效,但修不了新线路。
路线C是航空母舰,运力恐怖,但建造成本和维护费用天价。
路线D是公交车加地铁加共享单车的组合,灵活省钱,但换乘麻烦。
路线E是混动车,市区用电、高速用油,效率高但造价贵。
没有哪种交通工具是“最好”的,只有“最适合你今天的行程”的。
第五部分 CUDA的黄昏 生态不再是护城河
过去十年,CUDA是AI行业最坚固的壁垒。
它像一个巨大的磁铁,把所有开发者、所有模型、所有工具都吸附在自己身上。
你想换芯片?对不起,你得把整个软件栈重写一遍。
这就是CUDA的护城河:迁移成本高到让人绝望。
但这条护城河,正在被填平。原因有三。
第一,用户的需求变了。
训练用户需要CUDA。他们需要成熟生态、海量算子库、低迁移成本。CUDA无可替代。
但推理用户呢?他们的核心诉求只有两个:便宜,快速。
他们不在乎底层跑的是什么软件栈。只要便宜、好用,他们随时可以换。
第二,编译工具成熟了。
过去,换芯片等于重写模型。现在,有了PyTorch编译体系、Triton跨平台算子链,上层开发框架完成了硬件抽象隔离。
换芯片,不再需要重写模型。只需要替换后端调度与内存布局。
就像微信小程序:你在苹果上开发一次,安卓、网页、平板都能直接用。
第三,头部模型厂必然自建。
OpenAI、Google、Meta,这些公司都有足够的工程能力。
为了极致的成本可控、性能可控,他们一定会自建编译器、运行时与调度体系。
他们不会把自己的命运交在一家芯片公司手里。
核心趋势已经确定:
训练端,CUDA依旧稳坐王座。
推理端,CUDA壁垒持续崩塌。
未来AI Infra的核心壁垒,不再是软件生态,而是系统级Token成本优化能力。
当编译工具打破了CUDA的“应用壁垒”,用户就开始比真本事了:谁的Token更便宜、更快、更省电。
CUDA“一栈通吃”的时代,彻底结束了。
学生版:
想象你一直用苹果手机,App Store里有几千个应用。换安卓手机就意味着所有App都得重新下载,甚至有些根本没有安卓版。这就是CUDA的生态锁定。
但现在出现了“跨平台编译器”,就像微信小程序一样。你在苹果上开发一次,安卓、网页、平板都能直接用。
这时候,你还会因为“应用多”而死守苹果吗?
不会。你会开始比较:哪个手机拍照更好、电池更耐用、价格更便宜。
推理赛道就是这样。当编译工具打破了CUDA的“应用壁垒”,用户就开始比真本事了:谁的Token更便宜、更快、更省电。
第六部分 第一性原理——回到原点
最后,让我们回到一切的原点。
Bill Dally的四条原则,是整个芯片架构设计的基石。
第一,计算从来不是瓶颈,数据移动才是。
别纠结“算得快不快”,先解决“数据搬得近不近”。
第二,可静态预测的流程,编译器可以完胜硬件。
如果流程是固定的,让软件提前规划好路线,比临时反应更快。
第三,动态不确定的模型,必须依靠异构与可重构架构。
如果流程是不确定的,那就得准备多个备选方案。
第四,想要数量级的性能突破,必须跳出局部最优,主动取舍牺牲。
想要十倍提升,就别想着在原路上小修小补。得换一条路走。
云端推理芯片竞争的终极本质是:
在算力、带宽、容量、通信、能耗、通用性的互斥约束下,
结合电力、成本、模型、供应链的外部市场规则,
寻找全局最优的系统级Pareto解。
未来的行业公式已然清晰:
推理芯片 = 以Token为货币、以局部性为核心、以异构系统为产品的AI基础设施。
算力内卷的时代落幕,Token成本为王的时代,正式开启。
尾声:故事才刚刚开始
还记得开头那位失眠的CTO吗?
三个月后,他的团队完成了一次架构升级。
他们把推理集群从纯GPU换成了GPU加SRAM专用芯片的异构系统。
结果是:Token成本下降了60%,电费下降了45%,用户响应速度提升了2倍。
他终于在凌晨两点睡着了。
但他知道,这只是开始。
芯片战争还在继续。新的架构、新的材料、新的编译器,每天都在涌现。
而这一切的背后,只有一个简单的驱动力:
人类对智能的渴望是无限的,这场战争,没有终点线。只有不断的迭代和进化。
谁能把Token成本降到足够低,谁就能让AI真正走进千家万户。
而我们,正站在这场变革的起点。
《薛定谔的AI研究院》09月发布
AI产业趋势对硬件市场规模的变化预测
硬件替代:通用GPU → 专用ASIC异构系统
价值重心:计算芯片 → HBM存储+高速互联+散热电力系统
一 训练芯片(数据中心训练加速器)
2025年全球市场规模278.4亿美元,2030年预计892.6亿美元,五年复合增速CAGR 26.3%。
中国市场2025年89.7亿美元,占全球32.2%。
结构性核心变化:
模型底座成熟、迭代趋稳,一次性大额训练投入递减,AI资本开支主力彻底从训练转向推理。
早期高爆发时代结束,训练芯片由“AI核心增量”变为“存量稳态市场”。
二 云端推理芯片(AI未来第一主战场·核心增量)
多权威口径交叉收敛,为当前AI硬件增速最高、空间最大、确定性最强的核心赛道。
核心规模:
2025年全球云端推理芯片市场中枢1021亿美元,同比增速52.6%,增速是训练芯片两倍以上。
QYResearch 2025年499.5亿美元,2032年2802.8亿美元,CAGR 27.9%。
结构质变:
2023年推理算力仅占总算力33%,2026年反超至66%,2030年独占80%AI计算资源。
2026年是AI行业历史性拐点:推理硬件规模正式超越训练硬件。
整个赛道增长完全由全球Token生成总量、Agent自动化交互、长对话流量驱动,是未来五年AI硬件唯一超级大盘。
通用GPU推理份额持续被替代:
2023年通用GPU承载90%云端推理负载,2026年降至72%,2030年跌至55%,通用芯片推理溢价持续瓦解。
专用/异构推理芯片(SRAM近存、晶圆级、可重构、分层存储ASIC):
2025年63亿美元,2030年471亿美元,CAGR 30.2%,全硬件赛道增速第一。
行业彻底告别“单卡通吃”,低延迟、超大上下文、高吞吐场景各自被专属架构瓜分。
三 端侧推理芯片(高出货、低单值、海量渗透)
端侧AI芯片呈现出货爆炸、单颗价值微薄、渗透率快速抬升特征。
2025年全球端侧AI推理芯片规模中枢127–178亿美元,同比增速34%–47.9%。
全年芯片出货量12.3亿颗(高口径)/9.8亿颗(保守口径)。
智能手机、IoT、穿戴设备AI渗透率已达41%,较2023年提升18个百分点。
人民币口径对照:2025年约1800亿元,2028年突破3000亿元。
核心特征:
终端设备数量无穷扩张,但受功耗、面积、成本约束,单芯片ASP仅1–10美元。
整体市场体量远小于云端推理,属于“量大利薄”赛道。
四 HBM存储(AI硬件价值最大迁移方向)
AI瓶颈彻底从计算不足转向数据搬运不足,HBM成为AI硬件结构性最大赢家。
权威口径:
2025年HBM市场88.8亿美元,2026年125.6亿美元,2031年468.2亿美元,CAGR 30.1%。
供需爆发:
2025年HBM总需求2678单位,2026年4709单位,同比暴涨76%。
HBM在DRAM整体市场占比,由2024年5%跃升至2026年10%。
服务器BOM结构彻底重构:
2023年AI服务器:计算芯片62%、存储22%;
2030年AI服务器:计算芯片44%、存储+互联41%。
存储价值权重几乎追平计算芯片。
叠加AI-SRAM、高速SerDes、片间互联硬件:
2025年98亿美元,2030年276亿美元,持续高增。
五 数据中心配套硬件(电力·散热·组网·调度)
AI竞争进入系统级成本优化时代,配套基础设施价值重估。
全球数据中心整体市场:
2025年2356.5亿美元,2034年4817.3亿美元,CAGR 11.4%。
AI冷却/液冷高景气细分:
全球冷却市场:2025年187.8亿美元,2032年424.8亿美元,CAGR 12.4%。
全球散热大盘:2025年263亿美元,2033年1283亿美元,8年翻5倍。
行业逻辑彻底切换:
从“堆GPU算力”,升级为整机柜Token成本、PUE、散热效率、集群调度效率的系统竞争。
六 自研推理ASIC(GPU最强替代·结构性颠覆)
定制AI ASIC是未来两年AI硬件最强替代变量,增速碾压通用GPU。
市场规模:
2026年全球定制AI ASIC规模600–700亿美元,行业复合增速40%–50%。
结构替代量化:
2026年ASIC加速器出货770万片,占AI加速器总出货45%;2027年ASIC份额反超GPU,达到58%。
增速对比:
ASIC年增速44.6%,是商用GPU增速(16.1%)的近3倍。头部云厂商、模型公司全面去GPU化,通过自研芯片+自研编译器+自研运行时实现Token成本极致下压。
《薛定谔的AI研究院》 历史文章分类
第一类 AI硬件和软件的破局者
《DeepSeek推动AI产业再进化》
《DeepSeek的下半场 逆转产业趋势》
第二类 产业落地路径
《AI产业困境与“奶头乐”战略出路》
《十大科技原创预测》
《机器人产业化五种形态》
第三类 技术范式革命
《DS4 vs 分形大模型:关于AI未来的“改良与“创新》
《分形大模型:基于宇宙自相似结构的AI生成范式》
第四类 全球产业格局
《2027 东方崛起:「东器西算」》
《东器西算|算力范式彻底重构》
第五类 硬件底座与资本市场
《长鑫3万亿只是起点|国产算力集群全面国产化》
《不用疯狂堆GPU!用盖房子讲透AI大变局》