乐于分享
好东西不私藏

AI 的第一性原理 | 大模型的试错守恒定律

AI 的第一性原理 | 大模型的试错守恒定律

一、能力是怎么来的

从一个最基本的问题开始:任何形式的能力,到底是怎么来的?

一个小孩学走路。他站起来,摔倒,再站起来,再摔倒。每摔一次,他的身体就排除了一种不正确的发力方式。摔了几百次之后,大部分错误的方式都被排除掉了,剩下的就是"会走路"。

一个厨师学做菜。盐放多了,下次少放一点。火开太大糊了,下次调小一些。油温不够没炸透,下次等久一点再下锅。每一次失败都排除了一种错误的做法。做了几千道菜之后,他的手感和直觉就是从这些失败里长出来的。

一个程序员学写代码也一样。写了跑不通,报错,改,再跑,又报错,再改。每一个 bug 都在教他"这样不行"。写了十几年之后,他看一眼代码就知道哪里会出问题,这个判断力不是天赋,是从无数次试错里提炼出来的。

你去观察任何一种能力的习得过程,底层结构都是一样的:大量试错,排除错误的方式,留下来的就是能力。

试错是力的原材料。没有捷径。

二、大模型的能力也是这么来的

理解了能力的来源,再看大模型就很清楚了。

GPT、Claude 这些模型在训练的时候做的事情,跟小孩学走路在结构上没有区别。模型一开始什么都不会,你给它一个问题,它的回答几乎是随机的。然后训练系统告诉它"这个回答不好",模型调整参数,再试。"这次好一点了",再调整,再试。

这个过程重复几百亿次,覆盖人类写下过的海量文本。每一次调整,都在排除一种不好的应对方式。几百亿次之后,绝大多数不好的方式都被排除干净了,留下来的就是我们看到的那些惊人的能力。

你问它"Python 怎么读 CSV 文件",它秒答。为什么?因为类似的问题在训练中出现过无数次,所有错误的回答方式都已经被排除了,剩下的就是最靠谱的那几种写法。

你让它写一首现代诗,它写得还不错。为什么?因为训练数据里有海量的诗歌,什么是好的节奏感、什么是烂俗的意象,这些判断在训练过程中已经通过无数次试错被编码进了模型参数里。

所以当你觉得一个模型"很聪明"的时候,你看到的其实是一个结果。这个结果背后是天文数字的试错,那些试错花掉的算力和时间就是训练成本。

换个说法:你今天用模型的时候觉得它快、准、便宜,是因为这道题的试错费,别人在训练阶段就替你付过了。

三、但你的具体问题,没人替你练过

这是整篇文章最关键的一个转折。

模型的训练覆盖了什么?覆盖了通用知识。"怎么排序一个数组"、"HTTP 的状态码各代表什么意思"、"写一封商务邮件该用什么语气",这些问题在训练数据里被翻来覆去地见过,试错成本早就付清了。

模型的训练没有覆盖什么?你的具体问题。

"我们公司这个用户系统,在周三下午流量高峰期偶尔会出现登录超时,日志里显示的是数据库连接池耗尽,但连接池配置是够的,我怀疑是某个慢查询没有释放连接"。

这个问题,训练数据里不会有。不是因为它太难,而是因为它太具体了。你的系统架构、你的流量模式、你的配置参数、你的那条可疑的慢查询,这些组合在一起是独一无二的。全世界不会有第二个人在公开文本里写过完全一样的情况。

模型面对这种问题的时候,它的通用知识只能给你一个大方向:"连接池耗尽一般可能是慢查询、连接泄漏或配置不当"。但具体到你的情况该怎么排查、先查哪里、可能踩什么坑,它没有提前试过错。

这段距离,就是模型训练已经覆盖的通用知识和你的具体问题之间的距离。

这段距离不会凭空消失。必须有人来走完它。

四、这段距离的代价必须被支付

谁来走?怎么走?

一种方式是让 AI 自己走。你把问题扔给它,它开始尝试:先给一个方案,你说不对,它换一个,还是不对,再换。每一轮尝试都在消耗 token。它其实就是在做训练阶段没有做过的那部分试错,只不过是在运行时做,按 token 收费。

有个真实的案例。一个 AI 被要求处理一个数据库字段类型变更的问题,错误信息它已经读到了。然后它花了 47 轮反复尝试同一条命令的各种语法变体。几毛钱的问题,最后花了 30 美元。

为什么?因为这个具体的数据库 schema,模型的通用训练没有覆盖。模型只知道"ALTER TABLE 大概可以改字段类型"这个通用知识,但具体到这个表、这个约束、这个版本该怎么操作,它不知道。于是它只能在运行时盲目搜索,每搜一次就收一次 token 的钱。

另一种方式是人自己走。你凭自己的经验判断"这个问题八成是那条慢查询导致的,我先去查那个",直接跳过了大量不必要的弯路。快,但花的是你的时间和精力。

还有一种方式是人带着 AI 一起走。你给 AI 一个方向性的判断,AI 在这个方向上去做具体的执行和验证。你的判断力缩小了搜索范围,AI 的执行力走完了具体的路。这也是目前效率最高的方式。

但不管用哪种方式,那段距离必须被走完。试错的总量不会因为你换了一种支付方式就减少。

五、人也是训练出来的

这里有一个很容易被忽略的事实。

你之所以能看一眼就判断"这八成是慢查询的问题",是因为你在过去的职业生涯里见过类似的情况。可能是你自己踩过这个坑,可能是你同事踩过你在旁边看着,可能是你在某篇博客里读到过。

你的这个判断力是怎么来的?跟大模型一模一样,也是从大量试错里来的。你也经历了一个漫长的"遇到问题、尝试解决、失败、总结教训、下次避免"的过程。只不过你的训练数据是你的人生经历,你的训练成本是你过去十几年花掉的时间和精力。

当你介入 AI 的工作过程,说了一句"方向不对,应该从这边查",你做的事情本质上是:把你过去十几年试错积累下来的判断力,注入了当前这个问题的求解过程。你用你自己的"预训练成果",一句话就把 AI 从一个巨大的搜索空间拉到了正确的小区域。

这就是为什么高手用 AI 的效率远高于新手。不是因为高手提示词写得更漂亮,而是因为高手身上带着更多"已经付过的试错成本",他们能提供更精确的方向,让 AI 少走很多弯路。

那为什么 AI 不能自己做到这一点?

因为你的判断力来自你在你自己的领域里十几年的深度积累。这种积累是高度个性化的,高度情境化的。训练数据里有的是通用模式,没有的是"你在你的公司、你的系统、你的团队的上下文里积累的那些具体经验"。

这是一个当前模型跨不过去的缺口。模型可以学会通用的排查方法论,但它学不会"你们公司那台老服务器一到周三就有这个毛病"。这种知识只存在于你的脑子里。

人不能被剔除,不是因为某个技术环节还没做好。而是因为人带着的那些判断力,是当前模型训练不出来的东西。

六、试错守恒定律

现在可以把前面的线索收拢成一句话了。

解决任何一个具体问题,都有一个客观存在的试错总量。这个总量不会因为你使用了更好的工具而减少,不会因为你换了一种工作流而消失。它只能被转移,不能被消灭。

它在三个地方之间流动:

模型的预训练。这是提前支付的部分。训练数据覆盖到的那些通用知识,试错成本已经付过了,你用的时候不需要再付。

运行时的 token。这是当场支付的部分。你的具体问题超出了训练覆盖的范围,AI 在运行时做试错,每一轮消耗 token。

你本人的时间和判断这是你过去已经支付过的部分。你用几十年积累的经验来提供方向,本质上是在使用你自己早已付清的试错成果。

三者可以互相替代。模型更强了,预训练覆盖的范围更广,运行时需要补的试错就少了,token 就省了。你的判断力更强了,能给出更精确的引导,AI 不用走的弯路就多了,token 也省了。反过来,如果模型对你的问题没什么先验知识,你自己也不太懂,那就只能靠大量 token 暴力搜索。

总量守恒。没有任何方法可以凭空减少试错的总量。你能做的只是选择在哪里支付,以及让每一次试错都更高效。

七、这个定律能解释什么

想清楚试错守恒之后,很多之前说不清楚的事情突然就有了统一的解释。

"AI 为什么有的事做得好有的事做得差?"因为做得好的那些事,试错成本在训练时就付过了。做得差的那些事,训练没覆盖到,需要在运行时临时付。运行时试错的效率远低于训练时的效率,所以表现就差了。

"为什么 AI 做通用任务便宜,做你的具体项目贵?"因为通用任务的试错成本已经被预付了,你只需要付最后那一小段距离的钱。你的具体项目离训练数据越远,需要补交的试错就越多,token 就越贵。

"为什么专家用 AI 比新手高效得多?"因为专家自己带着大量已经付过的试错成本,他的判断力就是他过去几十年试错的结晶。他把这些结晶注入 AI 的工作过程,直接砍掉了大量无效搜索。新手没有这些积累,只能看着 AI 在那里盲目尝试。

"AI 什么时候能彻底替代人?"当模型的训练能够覆盖到你的具体问题的时候。也就是说,当训练阶段能够预付的试错范围大到足以覆盖你遇到的所有情况时,运行时就不需要人来补了。但考虑到现实世界的问题是无限具体、无限多样的,这个"完全覆盖"在可预见的未来都做不到。

所以对每个人来说,最实在的结论可能是这个:

你能做的最有价值的事,就是持续积累你自己的试错经验。因为这些经验就是你的判断力,你的判断力就是你在 AI 时代最不可替代的资产。AI 可以替你执行,但替不了你判断。而判断力没有捷径,它就是你过去所有试错的总和。

工具会换,模型会迭代,但你身上积累的判断力,只要领域还在,就永远有效。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛