乐于分享
好东西不私藏

显卡还在空转烧钱?国产软件榨干算力,AI价格终于打下来了

显卡还在空转烧钱?国产软件榨干算力,AI价格终于打下来了

近几年来,算力浪费成为了AI行业的最大短板之一,推理场景中的GPU空转通过吞噬大量算力和电费,来拉高AI服务的价格,也让我们意识到没有高效调度和软件优化的加持,AI推理将会举步维艰。

为了突破推理效率瓶颈,行业内大量的相关团队纷纷开始布局推理引擎优化,并且在极短的时间内强势崛起,键值缓存复用、连续批处理、预填充与解码分离等技术的相继落地,也让产业链格局悄然生变。

可以说,单纯堆硬件非但没有解决推理阶段的空转问题,反成为了推动推理引擎升级的助力。于是,为了进一步压榨GPU的每一分算力,行业不仅推动键值缓存复用、连续批处理等技术落地,同时还开始尝试预填充与解码分离、低精度计算、投机采样等优化手段。

对此,这篇报道并不看好盲目扩容的做法,它表示:单纯增加GPU数量是徒劳,这种做法只会使企业花更多时间和金钱来维持算力规模,却无法真正提升有效推理效率。

同时,不仅是行业专家,很多应用厂商对于这一问题都表示了担忧,称只关注模型参数的做法不仅会造成算力浪费,还会进一步抬高AI服务的价格。

在AI应用落地的这些年,行业在推理效率上已经逐渐突破,有外媒表示:推理引擎相当于摊牌了

首先,从卡内基梅隆大学公布的监测数据来看,756块GPU在31天里,集群整体约20%执行时间、11%能耗处于空转。要知道,推理场景的空转更加严重,这足以说明现有算力存在巨大浪费,明天在推理引擎优化方面也会持续突破。

在推理市场,因为我们的推理优化起步较晚,目前基于大模型的生成式应用仍旧是主流,为了满足市场对于低成本推理的需求,推理引擎扛起了大旗!已经先后通过键值缓存复用、连续批处理等手段优化部署,主要就是用来减少GPU空转,预计可让推理成本大幅下降。

同时,一些头部科技企业,也开始自研推理引擎,那些算力需求大的平台,即便承受着高昂的电费压力,可它们已经明确表示会把资源投向推理优化。像键值缓存复用、连续批处理等技术,这些优化的门槛都不算低,软件团队目前的水准已经足以满足落地需求,所以推理引擎已经扛起了重任。

其次,行业专家也已经正式表态,为了促进模型效率和应用体验相结合,将会重建推理架构,优化计算引擎。

可见,行业已经规划好算力运营策略,将会把重心放到推理引擎的打磨上,这也是AI基础设施的发展需求。