ARTICLE · 1074597
漫话AI:智算云平台Serverless技术原理与应用
当下,最动听的那一句就是:“家人们,我把XXX价格打下来了”。
算力也是一样,它的起步价格确实有点高,GPU/加速卡的硬件还受技术与产能以及政策限制,还不能快速降价。
Serverless技术,可以在很大程度上降低这些算力资源成本及使用成本。
今天峰哥就给大家伙展开讲讲。峰哥为什么写这篇文章呢,一是科普,另一方面峰哥所在公司九章云极的智算云平台实现了Serverless,有一定的技术探索经验和素材,话不多说,开始吧。
ㅤ
你想上线一个AI应用,传统做法是先租一台GPU服务器:不管今天有一万个请求还是零个请求,钱都按月烧。Serverless把这套逻辑倒了过来——没有请求就不花钱,来一个请求才拉起算力。在智算云上,它正在把昂贵的GPU算力变成"网约车":不用买车、不用养车,招手即走,按里程付费。

📖 知识卡:Serverless ≠ 没有服务器 服务器还在机房里跑着,只是开发者看不见、也不用管:不用选配置、装系统、半夜扩容。平台像网约车公司一样包揽一切——派单(请求调度)、加车(自动扩容)、收钱(按请求精确计量)。你只管写代码,剩下的全是平台的事。"无服务器"指的是"无服务器运维",机器一台都没少。

📖 知识卡:FaaS 与 BaaS——Serverless 的两大形态 FaaS(函数即服务):把一段代码交上去,平时不运行,来一个请求才执行一次,执行完就释放,代表是2014年上线的AWS Lambda。BaaS(后端即服务):数据库、对象存储、鉴权这些后端组件由云平台托管,按调用量付费。两者拼起来,开发者手里只剩业务代码,其余全是租来的。

一、为什么智算云需要Serverless
AI推理的流量像过山车:白天高峰、深夜空谷,爆款应用一夜之间请求翻百倍。传统"包机"模式必须按峰值配置,集群平均利用率常常只有一两成,GPU却在24小时不停地折旧烧钱——深夜机房里成排的卡基本在空转。Serverless按请求弹性伸缩,例如白天运行多个实例,晚上就安排一个值班的实例即可,让成本曲线贴着流量曲线走。

二、核心技术原理:四件套
第一件,请求级调度。 平台把用户的函数或服务切成一个个独立请求,统一排队、分发、回收,处理完立刻归还资源。就像餐厅叫号:来一桌开一桌,翻台即走,绝不提前把整层楼包下来等客人。调度器还会看"亲和性":谁的显存里刚好缓存着这个模型,请求就派给谁。

📖 知识卡:冷启动——秒级弹性的最大拦路虎 实例从零启动要拉镜像、分配GPU、加载模型。一个7B大模型仅权重就有约14GB(FP16),光从硬盘读进显存就要几十秒——这段"客人到了车还没热"的时间叫冷启动。云厂商的三板斧:①快照技术,把实例内存状态存下来,下次直接恢复现场;②模型缓存,热门模型提前放在离GPU最近的存储里;③保温池,常驻少量热实例应对突发。

第二件,扩缩到零与秒级拉起。 没有请求时实例全部释放,资源归还资源池;请求洪峰来了,平台在秒级内并行拉起成百上千个实例。为了不让用户干等,平台会提前"预热":把系统镜像和热门模型铺到各个节点,请求一到就跳过大头准备工作,直接开跑业务逻辑。

第三件,GPU虚拟化与显存共享。 一张80GB的大卡切给多个租户合用:硬件级切分划出独立小卡,时间片轮转让多个实例轮流上卡,再配合显存分级换入换出。租户之间互相隔离又互相补位,一张卡的利用率能从三成拉到七八成,每一段算力的租金都被摊薄了。当前主流的GPU虚拟化技术是英伟达的MIG和vGPU技术,后边峰哥再单独写文章给大家介绍。

第四件,按量计费。 计量粒度精细到秒甚至毫秒,按"实际算力 × 实际时长"收费:这次请求用了0.8秒GPU、下次用了1.2秒,账单分开记,空闲一分钱不收。成本和业务曲线直接对得上,财务不用拍脑袋猜该买多少服务器,老板也能看懂每一笔钱花在了哪。

三、三类典型应用
① 推理API托管。 文生图、聊天机器人这类流量波动极大的服务,白天可能涌进上百万请求,凌晨只剩个位数。放上Serverless正合适:闲时归零,爆款洪峰自动扩容,不用提前囤卡赌流量,也不用深夜守着空转的GPU付电费和折旧,成本随用随停。

② 批量数据处理。 文档解析、音视频转写这类突发性批量任务:一万份合同今天必须解析完,丢进Serverless并行拉起几百个实例,几分钟干完,跑完即释放。按量计费下,只为那几分钟的真实算力买单,一分钱也不浪费在闲置的服务器上。

③ Agent工具调用。 智能体每一步都在调用外部工具:查天气、搜资料、算数字,全是短平快的函数请求,用完即走,天然契合Serverless的计费粒度。
当然它有边界:长连接、超低延迟、常年打满的稳定负载,仍适合包机常驻——Serverless省的是闲时的钱,不是忙时的钱。选型前先看流量曲线,再决定买车还是打车。
结语
Serverless之于智算云,就像网约车之于出行:不是要取代买车,而是让"偶尔用车"的人不必为闲置买单。随着冷启动被压到秒级、GPU共享越切越细,"用算力像用水电"正在从发布会口号,变成账单上看得见的数字——这一次,口号是真的。很多开车的朋友算一笔账后,发现自己养车(折旧+油电费+停车费/车位费+保险+洗车费...)跟打出租车或顺风车上班相比,成本要高出很多,就是这个道理。

参考资料:AWS Lambda官方文档;CNCF Serverless白皮书;九章智算云AlayaNeW Cloud官方文档。