乐于分享
好东西不私藏

AI从“学习时代”到“推理时代”转变

AI从“学习时代”到“推理时代”转变

AI产业正在经历一场静悄悄的革命——从“训练为主”转向“推理为主”。联想杨元庆在5月22日的财报沟通会上明确预测:未来70%的GPU算力将用于推理,只有30%用于训练。这意味着AI终于要从“学习阶段”进入“干活阶段”了。

推理成本暴跌,让AI大规模应用成为可能

5月22日,DeepSeek官方宣布了一个重磅消息:DeepSeek-V4-Pro模型的API价格将于5月31日结束2.5折优惠后,正式调整为原定价的1/4,而且是永久降价。

这次降价力度有多大?

新费率显示:每百万Tokens输入(缓存命中)仅需0.025元,输入(缓存未命中)3元,输出6元。什么概念?就是说,如果你是个开发者,每天用AI写代码、做智能体,消耗的Token成本直接砍到原来的四分之一。

DeepSeek官方还特意说明:官网和App目前都是免费的,不受API调价影响。所以普通用户不用担心,受影响的主要是那些每天要消耗大量Token的开发者和企业用户。

为什么降价这么狠?因为推理成本真的在暴跌。

数据显示,2026年5月第一周,中国AI大模型的周调用量达到了7.941万亿Token,而同期美国只有3.76万亿Token。中国的调用量是美国的2.11倍。这说明什么?说明中国的AI应用正在爆发,推理需求正在指数级增长。

规模上去了,成本自然就下来了。这跟云计算早期的路径一模一样——用的人越多,单价就越便宜。

实时响应需求倒逼基础设施转型

为什么推理会超过训练,成为算力的主要消耗方向?

很简单,因为训练是“一次性”的,而推理是”持续性“的。

训练一个大模型,可能需要几千张GPU跑几个月,但训练完了,这个模型可以用很多年。可是推理呢?每一次用户提问,每一次AI回答问题,都要消耗算力。用户越多,提问越多,推理消耗就越大。

而且,推理对实时性的要求比训练高得多。

训练可以慢一点,反正跑几个月都正常。但推理不行,用户问个问题,等了3秒还没反应,可能就直接关掉页面了。所以推理需要的是"快速响应",而不是"海量并行计算"。

这就倒逼基础设施转型。

以前的GPU服务器,都是为训练设计的——追求的是怎么把几千张卡组成一个超大计算集群,一次性处理海量数据。但现在,推理需要的是"分布式、低延迟、高并发"的架构。

联想杨元庆说,目前AI基础设施中,70-80%的GPU服务器用于训练,只有20-30%用于推理。但未来会反过来,70%用于推理,30%用于训练。

这个转型已经开始。5月19日,联想发布了天禧AI4.0,这是一款端边云一体化混合部署的AI主机。最关键的数据是:80%的token在本地完成推理。这就意味着,大部分推理不需要跑到云端,本地就能搞定,响应速度自然就快了。

硬件架构正在为推理重新设计

推理时代的到来,也在倒逼硬件架构的革新。

首先是CPU

5月24日,AMD宣布下一代EPYC CPU(代号"Venice")进入量产,这是业界首款在台积电先进2纳米制程技术上进入量产的高效能运算产品。这款CPU专门为AI推理优化,不是传统的通用CPU。

为什么?因为推理不需要那么多浮点运算能力,但需要更快的内存访问速度、更低的延迟、更高的能效比。所以,"Venice"的设计思路完全变了。

其次是散热

AI推理虽然单次计算量不如训练,但因为要7x24小时运行,发热量其实更稳定、更持续。这就对散热提出了新要求。

5月23日的报道显示,英伟达已经宣布下一代GPU芯片采用"金刚石复合材料+液冷"的全新散热方案。为什么用金刚石?因为金刚石是自然界已知的最好的导热材料,而且中国的人造金刚石产量占全球的95%,其中80%集中在河南省。这又是一个中国在供应链上占据绝对优势的案例。

最后是内存

美光CEO桑杰·马罗特拉在接受采访时发出预警:当前全球内存短缺可能延续至2026年之后,而行业真正意义上的大规模新产能释放,至少要等到2028年。

为什么内存会短缺?因为AI推理需要大量的内存。训练的时候,你可以把模型分成几块,分别放在不同的GPU上。但推理的时候,模型通常要完整地加载到内存里,这样才能快速响应。所以,推理对内存的需求,比训练还要大。

AI从"训练时代"进入"推理时代",这不是一个技术话题,而是一个产业话题。

训练时代,拼的是谁的模型更准、谁的参数量更多,那是巨头们的游戏。但推理时代,拼的是谁的成本更低、谁的响应更快、谁能真正把AI用起来,这是所有企业都能参与的游戏。

DeepSeek降价、联想推本地AI主机、AMD量产2nm CPU、英伟达用金刚石散热……这些新闻看起来互不相关,但其实都在指向同一个方向:AI正在从"实验室"走向"生产线",从"玩具"变成"工具"。

这才是AI真正的黄金时代。

#AI#职业#焦虑#生活#科技