前阵子帮一个做电商的朋友算 AI 客服的成本账,算完我自己都愣了一下。 搁 2023 年,他那点咨询量,跑个像样的大模型,一个月算力成本少说大几万。现在呢?换了个蒸馏后的小模型,功能没差多少,成本直接砍到原来的十分之一不到。他说原来不敢开 7x24 小时,怕烧钱,现在不仅全天开着,还敢给新客户送免费试用额度。
不知道你有没有类似的感觉。这两年用 AI 工具,好像忽然就 “不值钱” 了。前两年刚火的时候,调用个正经大模型,一千 token 几毛钱,写篇长文几块钱就没了,用的时候都得数着字数。现在倒好,百万 token 的套餐十几块钱包月,大把工具直接免费,响应速度还比以前快了一大截。
更耐人寻味的是那些小模型。早些年几十亿参数的模型,大家都当玩具看,写个文案都颠三倒四。现在再看,十几亿、几十亿参数的模型,日常写稿子、做表格、答常识题,普通用户用起来,和那些几千亿参数的旗舰款,真没差出多少。
很多人不知道,这背后藏着行业里半公开的省钱密码,叫 AI 蒸馏。 明面上各家都在拼旗舰模型的参数、跑分、发布会排场,暗地里几乎所有公司都在闷头做这件事 —— 把大模型的本事,“灌” 进小模型的身子里。

说穿了其实也没啥玄乎的,和老师傅带徒弟是一个道理。 老师傅手艺好,什么疑难杂症都能摆平,但工钱贵,精力也有限,一天干不了多少活。徒弟年轻力气大,工钱便宜,手脚麻利,就是经验浅,手艺糙。 蒸馏要做的,就是让老师傅把本事完完整整教给徒弟。不是只扔个最终答案,是连思考的分寸、判断的权重、那些只可意会的手感,都一并传下去。
放在 AI 里,老师傅就是大模型,参数多、能力强、推理贵、跑得慢;徒弟就是小模型,参数少、成本低、速度快,天生底子薄。 早年训小模型,都是拿标注好的标准答案喂。相当于只给徒弟看最终结果,让他死记硬背。背得多了,遇到原题会做,稍微变个花样就懵。 蒸馏不一样。它是让大模型先做一遍题,输出的不是一个标准答案,而是它对每个可能性的 “把握程度”。
比如一道选择题,大模型觉得 A 对的概率是 90%,B 有 8%,C 占 2%。这个带概率分布的结果,圈内叫 “软标签”。 就像你问大模型 “北京明天穿啥合适”,它最后回复你 “建议穿薄外套”,但背地里算过:15 度的天气,薄外套 72%,毛衣 20%,短袖 8%。这些没说出口的掂量,就是软标签。
然后拿这些软标签去训小模型。徒弟不仅知道答案是 A,还知道为什么不选 B 和 C,知道每个选项的分寸在哪。这么学下来,小模型摸到的是大模型的思考逻辑,不是只会背答案。 打个比方,以前是对着字帖描红,只描个字形;蒸馏是让大师握着你的手写,连运笔轻重、转折缓急都传给你。出来的效果,自然天差地别。

这个概念其实不算新鲜。2015 年,深度学习领域的几位先驱就发了论文,把这个思路整理清楚,起名叫模型蒸馏。 那时候没人太当回事。或者说,没人顾得上。 那些年参数堆得飞起,每涨一倍参数,性能就跳一大截,所有人都往大了做,谁有空琢磨怎么把模型做小啊。搞小模型,说出去都显得没实力。
真正把蒸馏从论文里拽到产业一线,是 2023 年底到 2024 年的事。 我记得特别清楚,2023 年下半年圈内聚会,大家聊的还都是 “你们训到多少参数了”“算力卡够不够”。到 2024 年开春再见面,话题全换成了 “你们推理成本压到多少了”“单卡扛多少 QPS”。变脸比翻书还快。
原因也不复杂。大模型热了一年多,所有人都撞上了同一堵墙:成本。 训一个千亿级大模型,几亿几十亿砸进去,是一锤子买卖。真正吞钱的是推理,用户每发一句话,后台都在烧 GPU。用户量起来之后,很多公司表面风光,背地里每多一个活跃用户,多亏一份钱。 商业化又跟不上。企业客户算得比谁都精,你 API 调用贵一分,人家转头就去算雇实习生划算不划算。C 端用户更不用说,免费的时候用得欢,一收费跑一大半。 这时候大家才反应过来,光堆大的没用,得想办法把成本打下来。蒸馏就这么被推到了台前。
最先跑通的还是 OpenAI。2024 年中,GPT-4o mini 上线,外界猜参数大概百亿级别,只有 GPT-4o 的零头。 刚出来的时候很多人没在意,觉得就是个凑数的入门款。结果一跑分,大多数常规任务上,性能能摸到 GPT-4o 的八成多,推理成本却只有几十分之一。 公开定价表上摆着,GPT-4o 输入每百万 token5 美元,输出 15 美元;GPT-4o mini 输入 0.15 美元,输出 0.6 美元。

差了三十多倍。 我自己后台测过同一批文案需求,原来用 GPT-4o 跑,一天大几百美金没了。切到 mini 之后,月底看账单,差点以为系统算错了。 三十多倍的差价是什么概念?就是原来雇一个资深专家的钱,现在能养一个小团队。换你是做产品的,你怎么选?
那段时间开发者圈子里,大家都在默默切接口。毕竟对八成的日常场景来说,那点性能差距用户根本感知不到,成本直接降 90% 以上,这笔账谁都会算。 国内厂商跟进得也快,或者说,被逼得更急。毕竟国内市场卷价格卷得厉害,你贵一厘,客户就跑隔壁去了。 前后也就两三个月,各家的 “轻量版”“极速版” 小模型全冒出来了。有的明说用了蒸馏技术,有的藏着不说。懂行的拉出来跑跑分,参数和性能一对照,心里就有数了。
有行业报告说,2025 年上半年国内大模型推理调用总量同比涨了 370%,对应的算力成本只涨了不到 80%。这数我没仔细核对过,但体感是对的。身边做应用的朋友,今年都敢放开做免费额度了,换去年,多开一天免费都心疼得睡不着。 没人会特意告诉你 “我们用了蒸馏技术”,但实惠已经悄悄落到了每个人头上。
蒸馏火起来之后,整个行业的玩法都悄悄变了。 最先松动的是算力市场的逻辑。 前两年大模型热潮,大家拼的是训练算力,谁手里 GPU 多,谁就能训更大的模型。那时候显卡一卡难求,价格炒上天,云厂商的算力实例抢都抢不到。 现在重心慢慢往推理侧转了。训练是一锤子买卖,推理是天长日久的开销。
蒸馏技术成熟之后,同样的算力,能扛住的请求量翻了好几倍。以前一张高端卡一秒处理几十个请求,现在跑小模型,能处理几百个。 单卡产出变高了,反过来就是说,不需要那么多卡来撑推理了。 前两年屯了一仓库显卡的贸易老板,去年年底碰见,愁眉苦脸的,说好多客户退了算力订单,说优化完了,用不了那么多。当然也不能全算在蒸馏头上,还有量化、剪枝这些技术,但蒸馏绝对是占比最大的那一块。
受影响更大的是创业圈。 前两年好多人唱衰 AI 创业,说千亿模型门槛几十亿,创业公司根本玩不起,最后只剩几家大厂寡头。这话听着挺有道理,就是没算到蒸馏这一步。 蒸馏直接把门槛打下来了。 不用自己训千亿大模型,拿开源的旗舰模型当老师,针对垂直领域的数据做蒸馏,几百万就能搞出一个好用的行业小模型。

部署成本也低,普通服务器就能跑,甚至能部署在客户本地,数据不用出域,对很多传统行业来说,反而更放心。 我见过最夸张的一个小团队,三个人,租了套民宅当办公室,拿开源大模型当老师,针对电商售后场景蒸馏了个小模型,卖给中小商家。一年下来,利润比好多几十人的公司都高。 不用养庞大的算法团队,也不用烧钱训基座,就盯着一个细分场景啃,活得贼滋润。
某种程度上说,蒸馏把大模型的 “权力” 给打散了。大厂攥着最顶尖的基座技术,但无数小团队,拿着蒸馏出来的小模型,钻进各个行业的缝隙里,做大厂看不上、也做不细的生意。
还有一个更隐蔽的变化,发生在端侧。 现在手机、汽车、智能手表,都在喊端侧 AI。你想想,手机芯片算力再强,怎么可能跑得起千亿参数的大模型? 能跑起来,全靠蒸馏。 把云端大模型的能力蒸馏到几十亿甚至几亿参数,就能塞进手机的专用算力芯片里。不用联网,本地运行,毫秒级响应,还不用担心数据上传的隐私问题。
你现在拿旗舰手机拍个文档,一键提取文字、生成摘要,全程不用联网,速度快得离谱。搁三年前你敢想?那时候随便个文本处理都得传云端等半天。 汽车上的语音助手更明显。以前说句话,得等个一两秒才回复,现在你话音刚落它就接话,差的就是云端往返和本地运行的距离。 这些用户能摸到的体验升级,追根溯源,都有蒸馏在背后托着。
当然,蒸馏也不是什么神丹妙药,包治百病。 最明显的短板,是能力上限。 徒弟再厉害,也很难超过师傅,这是常理。日常写周报、回邮件、整理会议纪要,你用蒸馏小模型,基本挑不出毛病,甚至比大模型还快。但真要让它做复杂的行业尽调,交叉核对十几份资料,推导演算,抠细节逻辑,差距一下就出来了。
要么前后矛盾,要么漏了关键信息,要么说的全是正确的废话。 行业里大概有个不成文的共识,百亿级别的蒸馏模型,能覆盖八成以上的日常需求。剩下那两成硬骨头,还得旗舰大模型上。 所以现在各家基本都是 “大小搭配”,简单请求自动走小模型,复杂的再切到大模型。既省了成本,又不丢体验。算盘打得都挺精。
还有个毛病,圈内叫 “蒸馏衰减”。 就像复印文件,原版复印一次,清晰度还可以;拿复印件再去复印,就发虚了;多复印几次,最后字都糊了。 模型蒸馏也是一样。用原版大模型蒸出来的第一代,性能掉得不多;有人图省事,拿别人蒸好的模型再二次蒸馏,成本是更低了,能力也垮得更快。 普通用户可能察觉不出来,觉得都是 AI,都能写东西。但天天跟模型打交道的人,上手聊三句话,就能闻出来是不是 “二手蒸馏” 的货。
最说不清楚的,还是版权边界。 这事儿在圈内吵了快两年了。我花钱买了你的 API,生成的结果我能不能拿来训自己的模型?说白了就是,我花钱请老师讲课,听完我学会了,自己开班收徒弟,算不算侵权? 前两年开源圈好多号称 “对标 GPT” 的小模型,扒开看,本质都是拿闭源 API 的输出蒸出来的。
成本低,见效快,涨粉涨得飞快。 后来有厂商急了,在服务协议里加了条款,禁止用输出内容训练模型。但怎么查呢?总不能扒开模型权重一个个比对吧。真打起官司来,举证都难。 2024 年倒是有几桩相关的官司,到现在也没个明确的定论。这条边界到底划在哪,全行业都在摸着石头过河。
往后怎么走?我感觉蒸馏不会是个过渡技术,反而会变成 AI 行业的基础工序。 就像炼油厂。原油开采出来不能直接用,得送进去分馏,出汽油、柴油、煤油、沥青,不同的产品对应不同的用途。 以后的大模型行业,大概率也是这个路子。 最顶尖的几家公司,专心训最强的基座大模型,相当于生产 “知识原油”。然后通过蒸馏,拆分成不同参数、不同能力等级的小模型,对应不同的场景。
最高性能的留在云端接复杂任务,中等的给普通 SaaS 应用,最小的直接灌到端侧设备里。 以后说不定还会出现专门的 “模型蒸馏厂”。你有一个大模型,想做成适合某个行业的小版本,不用自己动手,交给专业公司,他们帮你做蒸馏、做微调、做压缩,一条龙服务。 还有多模态蒸馏也是个方向。现在大多是文本模型的蒸馏,以后图片、视频、语音的蒸馏也会慢慢成熟。大多模态模型学通用能力,然后蒸馏出专门的小模型,放在相机里、音箱里、监控设备里,各司其职。

当然这都是我个人的猜测,也可能明天冒出来个新技术,直接把蒸馏拍死在沙滩上。AI 这行,什么都有可能发生。 但有一点是确定的:AI 不会一直往 “越来越大” 的路上一条道走到黑。当大到一定程度,边际收益递减,行业自然会往更高效、更便宜、更普及的方向走。 蒸馏就是目前这个方向上,最管用的一把钥匙。 它没有那么多花里胡哨的概念,也没有什么颠覆式的创新,就是一件朴实无华的、降本增效的事。但恰恰是这种事,最能推着行业往前走。 毕竟所有的技术,到最后都要落到实处:用得起,用得方便,用得划算。
说起来也挺有意思的。AI 圈天天都有新概念炸出来,今天这个架构明天那个范式,发布会一个比一个热闹。 但真正悄悄改变我们日常的,往往不是那些喊得最凶的,而是蒸馏这种,闷头干活、不声不响的技术。 你可能今天第一次听说这个词,但仔细想想,你手机上的 AI 功能、常用的免费 AI 工具、客服对话框里的自动回复,其实早就用上了。只是它藏在背后,你没察觉而已。
以后这样的技术还会越来越多。行业往前走的过程,就是把一个个高大上的技术,慢慢做便宜、做普及、做到普通人感知不到的过程。

我平时就爱琢磨这些事儿,不追那些花里胡哨的热点,就爱扒一扒技术背后的实在东西。要是你也喜欢听这种接地气的唠嗑,觉得这篇文章有点用处,麻烦顺手点个在看,给公众号加个星标。后面咱们接着聊,慢慢把 AI 圈这点门道,都唠得明明白白的。
夜雨聆风