乐于分享
好东西不私藏

从技术视角剖析AI时代“蒸馏”的真相

从技术视角剖析AI时代“蒸馏”的真相

背景

今天我们不讨论最新的 AI Agent 框架,也不讨论某个具体的技术实现,而是想聊一个大家这大半年讨论比较多的一个话题,就是“蒸馏”
我作为一名AI算法从业者,“蒸馏”这个词我自然是不陌生的,但是随着今年大家各种养虾(OpenClaw)、养马(Hermes)、各种 Vibe Coding、构建 Skill热火朝天的时候,“蒸馏”这个词就在各大文章、短视频、自媒体里刷屏了,大家都在讨论“蒸馏”、“反蒸馏”,或者用“某某人.Skill”表示“某某人”的蒸馏版。但说实话,很多小伙伴对这个概念还是有点云里雾里:到底什么是“蒸馏”?为什么叫“蒸馏”?而自己会不会被“蒸馏”呢
咱们今天就从技术角度来剖析一下“蒸馏”这个概念。(先提前声明、叠个甲:仅个人看法,请理性讨论,无任何立场和前提假设~)

溯源:蒸馏,原本是个化学概念

首先,咱们得先捋清楚一个概念:到底什么叫“蒸馏”?
“蒸馏”(Distillation)原本是一个化学领域的术语,是不是有种瞬间回到了中学化学课堂的感觉。而在化学里,它指的是一种能有效分离沸点不同成分的方法。
想象一下,你面前有一瓶混合了多种物质的液体。你如果要想把里面的各种物质逐层分离出来,靠的就是“蒸馏”。
举个最经典的例子:盐水(Salt Water)。如果我想把盐水里的水和盐分开,该怎么做呢?普遍的做法大致分两步:
  • 第一步是升温。通过加热,让混合物中沸点较低的成分先汽化
  • 第二步是冷凝。让这些气体经过冷凝管降温,重新变成液体收集起来。这时候,沸点低的物质就被先“蒸馏”出来了。而那些沸点高的物质呢?因为温度没达到它们的沸点,没法直接汽化,所以依然保持液态,留在了原容器里。
通过这一套流程,你就成功地把两种物质分离开了。如果你还想继续分离其他更复杂的成分,那就继续根据各物质之间不同的沸点,去调整温度和控制节奏,层层剥离。

学习:模型蒸馏,也先“升温”再“冷凝”

那这跟AI有什么关系呢?其实,机器学习领域里的“蒸馏”概念,要追溯到 2014 年了。当时,“AI 教父” Geoffrey Hinton,联合 Google 的 Jeff Dean 等各个大佬,发表了一篇里程碑式的论文:《Distilling the Knowledge in a Neural Network》,翻译成中文是:从神经网络中蒸馏知识。这篇论文正式确立了“知识蒸馏”(也叫“模型蒸馏”)这个概念的地位。
简单来说,蒸馏就是要把一个庞大、复杂的教师模型(Teacher Model),压缩成一个轻量级的学生模型(Student Model)。比如,把一个几千亿参数(几B甚至几T级别)的大型模型,蒸馏成一个只有几B甚至几M参数的小型模型。目标是让学生模型在特定任务上,拥有接近教师模型的能力。
怎么做到的呢?答案是拟合“函数”,如果把教师模型看作函数F(x),学生模型看作G(x),蒸馏的本质就是让G(x) 去无限逼近F(x)。这里一般有两种做法:
  • 硬标签:这是最直接的办法,是让教师模型给数据“打标”。比如做文本分类,让一个教师模型判断这句话是“陈述句”还是“疑问句”,然后把结果作为标签(Label)喂给学生模型训练。学生模型通过学习这些标签,模仿教师模型的决策。
  • 软标签(概率分布):这是更精确的做法,不仅是看外在的结果标签,还要学习教师模型的内在逻辑。教师模型输出时,不仅会给出答案,还会给出每个Label或Token的概率分布/可能性(Logits/Probability)。比如,教师模型认为 90% 是“陈述句”,10% 是“疑问句”。学生模型不仅要学“陈述句”这个结论,还要学这种“90% vs 10%”的概率分布。这样,学生模型学到的就不只是死板的答案,而是教师模型对不确定性的判断能力,效果会精准得多。
这就也能解释当下的 LLM 行业乱象。每当有一个新的 SOTA(State-of-the-Art,最先进)的大模型出现,其他模型如果想要“快速跟进”,蒸馏其实就是一种非常“抄近道”的策略,利用大模型强大的能力生成高质量数据、合成标签或逐个Token学习(比如一种蒸馏方法叫做 OPD,On-Policy Distillation),然后让自己的模型去快速训练、学习。通过这种方式,能快速将SOTA大模型的能力迁移过来,大幅降低训练成本和时间。
那么,问题来了,机器学习概念里的这个“蒸馏”为什么要起名字叫“蒸馏”呢?不能换个别的说法吗?和化学里的“蒸馏”有什么关系吗?
这就是因为在模型蒸馏的时候,有一个核心参数叫做Temperature(温度)。之所以使用这个名词来命名这个参数,是因为 Hinton 也借用了统计力学中“玻尔兹曼分布”的理念:是一个微粒在某个状态的几率,和那个状态的能量的指数成反比,和它的温度的倒数之指数成反比(我也听不太懂,你就知道和温度有关系就好了)。并且,这个参数是引用在了模型的Softmax 函数里,Temperature 基本上扮演了和化学蒸馏中“温度”几乎一样的角色。
可以看一下上面这张图,当温度T的值不同的时候,Softmax 函数返回的各类别的分布差异是不一样的。咱们来稍微拆解一下这个逻辑。当 Temperature 趋向于无穷大(也就是很高)时,Softmax 的输出会变得非常平滑,可以看到图中T是5的时候,各分类的差异变得不大,Top1和Top2的概率值变得很接近。比如大模型的原理是预测下一个 Token,在 Temperature 很大(高温下),各个候选词的概率差异会变小,分布更加均匀。你可以理解为,这时候模型不那么“固执”,它愿意把概率分散给更多的可能性,输出结果更加柔和、包容
反过来,当 Temperature 趋向于零(也就是很低)时,Softmax 的输出会收敛成一个类似 One-hot 的分布,可以看到上面图中,T是0.5的时候,Top1和Top2的概率值差异拉得很大。当 T 越趋近于0的时候,这种情况下模型会变得非常“极端”:某一个 Token 的概率极大,而其他所有 Token 的概率都趋近于零,其实就等同于 Max 函数了(看到这里,是不是就能明白为什么叫“Soft”Max了吧)。模型会毫不犹豫地选出它认为最正确的那个词,输出结果非常确定、尖锐
而蒸馏的核心逻辑,就是先高温“学习”,再低温“使用”。这是不是就跟化学里面的“蒸馏”对上了:
  • 训练/蒸馏阶段(升温):在训练阶段,我们使用较高的 Temperature。目的是让教师模型(Teacher Model)输出的概率分布更平滑,保留更多的“暗知识”(Dark Knowledge)。比如,虽然“猫”是正确答案,但模型也会给“狗”、“动物”一定的概率。学生模型(Student Model)通过模仿这种平滑分布,能学到更多细微的特征和关系,而不仅仅是死记硬背最终答案。
  • 推理/应用阶段(冷凝):当模型真正投入使用去推理时,我们把 Temperature 调低(恢复到低温状态)。这时候,模型基于之前学到的丰富知识,能够给出更稳定、更精准、更符合预期的结果。
所以,你看,这个过程是不是完美对应了化学里的蒸馏?先升温气化(高温训练,提取平滑分布中的精华信息),再冷凝收集(低温推理,得到稳定高效的输出)。

祛魅:别慌,那些关于“蒸馏”的真相

最后,我想再深入聊聊现在大家常挂在嘴边的“蒸馏”。
最近总有人调侃,说自己在“养”各种Agent,比如给 OpenClaw、Hermes 喂数据、喂工作流。大家觉得,用得越多,这些 AI 就越像是在“蒸馏”你的能力和做法。特别是在日常的生活、工作中,很多人正忙着把自己的业务流程、生活/工作习惯转化成各类 Skill。于是有很多人在自嘲:这不就是在“自我蒸馏”吗?
但实际上,从技术角度上来看,这充其量只是一种“行为模拟”,还很难说是真正意义上的“蒸馏”。
当你把工作流程写成 Skill 喂给大模型,本质上和写 Prompt 没区别。更多还是你是在指导它:“照着我这个步骤做。” 哪怕你再投喂一些你的“日常语录”,这也只是一种小样本学习(Few-shot Learning)。因为,大模型是一种 Few-Shot Learner(小样本学习者),模型有着很强的根据有限的样本,去模仿你的说话腔调或操作路径的能力,但这也仅仅就是在模仿而已。
所以,很多时候,大模型依据这些Skill,只能模仿“形”,无法复刻“神”。举个我自身的案例吧,前段时间有朋友觉得我写的文章质量比较高,拿我之前写过的文章去“蒸馏”了一个我的“分身 Skill”,“企图”想要“蒸馏”我的写作逻辑。然后生成出来的文章,乍一看文风有点像(其实也没很像),但读起来内容比较空洞,和我本人的文章差异还是有点大的。其实原因很简单,它只学到了我的“部分”遣词造句,也没有理解我背后的思维逻辑和认知深度,更不可能有我完整的经验和实践,所以,它最后写出来的文章没有灵魂,只有套路。
如果想要实现真正意义上的“个人蒸馏”,其实是难度还是挺大的,得需要有一个系统在无时不刻地收集你所有的数据,比如你的每一句言论、每一个表情;你各种“外化”的思考过程、潜意识的反应(内化的思考过程如果不透出的话,模型还是无法拿到);甚至可以逐 Token 去学习你的语言习惯。然后,通过这些海量数据去训练,才有概率训出一个与你思维模式、语气风格高度一致的模型。
现实是,这几乎很难做到。且不说隐私和技术门槛,单是“完整捕捉一个人的行为全貌”这一条,目前就基本没办法实现。所以,别太担心被“完全替代”,至少现阶段的大模型还没这个能力(叠个甲,至于未来发展成什么样,我无法预测哈)。
虽然“完全蒸馏”很难,但“部分替代”确实是正在发生。比如说,那些比较固定流程、标准化的工作。如果你的工作内容高度固化、机械化,比如每天就按部就班的数据处理、标准回复、固定模板的文案等等工作。这些是大模型比较擅长去“复制”的,但话又说回来,即使没有AI大模型,在传统时代,这类机械化的工作也会逐步被各类低代码工具、流程自动化的脚本所替代。AI 只是让这种替代变得更聪明、更无缝、更快速、更自主。如果你所从事的内容,还持续停留在这一层,那的确真的要尽早思考转型,否则被替代只是时间问题
但是,如果你持续拥有创造力、深度思考、独特认知。你对一件事情,有着独特的创意和想法;对事物深刻的洞察和理解;基于你个人成长经历形成的这些复杂的判断逻辑。至少现阶段还是可以放心的,这些内容是模型很难真正“get”到的。你见过的事、你思考的角度构成了你认知底色,同时也构成了你的“护城河”,这都是 AI 很难直接去 Copy 走的,独属于你的“思想内核”
因此,在人和 AI 之间,目前是存在一个“能力时间差”只要你的想法、思考足够深、足够独特,AI在短期内就追不上你,它可能能模仿你到一些皮毛,却无法复制你的精髓。所以,我觉得,不要焦虑于是否会“被蒸馏”,而要关注在“是否思考的足够深”。如果你做的事本身太流水账,确实还是要想想如何转到能发挥更多主观价值、需要深度判断的工作。多思考、多沉淀,不断拓宽认知的边界。换个角度想,让 AI 去从事那些相对低效、重复、机械化的脏活累活,把人解放出来去解决一些更有挑战的、更有价值的事情,其实也未尝不好~

总结

这篇文章,我从技术视角对“蒸馏”这个概念的一次拆解。我们首先回溯了“蒸馏”这个词的来源,它既是化学中分离提纯的概念术语,也是机器学习里一种经典的模型训练方法。而回归到当下,大家热议的所谓AI“蒸馏”,本质上更像是一种AI在做着小样本的学习和模仿,远未达到真正意义上对一个人思维内核的复刻。所以,在 AI 尚未掌握高阶“蒸馏”技术的窗口期,我们依然拥有宝贵的空间和时间,去深耕那些真正有深度、有意义的事情。
身处 AI 时代的浪潮中,未来注定充满不确定性与变革。没有什么太好的办法,我们必须要保持敏锐的观察与独立的思考,不断审视自己在未来的位置,以及我们与 AI 之间究竟该建立怎样的协作关系
当然,以上只是我个人的一家之言,难免简单,行文仓促,仅供大家参考,有说的不对的地方也请“轻喷”。也希望能抛砖引玉,引出更多关于这个话题更好的交流与碰撞。在这个 AI 快速变化的时代,让我们一起看看,还会有哪些新的想法与可能。