夜雨聆风学习资料网

ARTICLE · 1043702

为什么AI应用的"确定性"要靠AI+软件工程来解决

为什么AI应用的"确定性"要靠AI+软件工程来解决
看到标题有朋友可能会问:AI 应用到实际生产环境里,让它直接干不就行了,为什么非得落到软件上?
接下来就回答这个问题。

一、企业真正怕的,从来不是"不够聪明"

一个观察。
企业看 AI 的时候,最常问的是:"它够聪明吗?"
但真正让项目死掉的,往往不是"不够聪明",而是不稳定
差一点的答案,人还能补;而一个时好时坏的东西,没法用:
对账,这个月对得上,下个月对不上;
合同,这次写全了,下次漏一条;
分类,今天 95% 准,明天 60%。
这不是能力问题,是确定性问题

企业可以接受一个能力有限的员工,但没法接受一个每次表现都不一样的员工。

二、AI 的不确定,是它的本质

为什么 AI 会时好时坏?
因为它生成答案的方式,是按概率采样——根据上文,预测下一个词最可能是什么。
它不是查表,也不是推导。它是"采样"。
这带来两个后果:
  1. 同一句话问两遍,可能得到两个答案;
  2. 它说错话的时候,和说对话的时候一样自信。
而且这个问题不会因为模型变大而消失。模型越大,能力越强,但生成机制没变。
所以,"不确定"不是这一代模型的缺陷,而是它的本质。
(这也是为什么我一直觉得:把不确定性当成 bug 去修,方向就错了。)

三、从提示词到 Harness:一部"管住 AI"的工程史

这几年,整个行业的工程重心一直在快速迁移。目标都是同一件事:把 AI 管住。
回头看,大概走了四个台阶:
阶段
时间
做的事
天花板
① 提示词工程
2022–2023
把话说清楚:少样本、思维链
提高了概率,但还在概率里
② 工具调用(Function Calling)
2023–2024
让它能做事:调 API、查数据库、RAG
单步查得到,不等于整体对
③ 上下文工程
2024–2025
管好它看到什么:记忆、检索、工具反馈
信息给对了,判断仍是概率的
④ Harness 工程
2025–2026
给它搭执行环境:沙箱、工具、权限、验证与恢复
出错更少了,但机制没变
(Claude Code、Codex 这类产品,本质上都是"harness"——围在模型外面的那层执行外壳。)
每一次升级都是真进步:AI 从"只能聊",到"能查",到"能干活",再到"能在受控环境里干活"。
但它们做的其实是同一件事:让不确定的东西,出错再少一点。
而且这里有一个挺残酷的数学:

单步准确率 95%,听起来不低。 但串十步之后:0.95 的 10 次方 ≈ 60%。

有意思的是,最新的 Harness 工程已经开始谈"验证"和"恢复"了——它试图在模型外面再套一层纠错机制。
但那仍然是概率域里的兜底:错了就重试、就问人、就回滚。
而确定性的意思是:它本来就不该那样错。
所以这些工程方法都有价值,但它们做的是"降低风险",而不是"消除不确定"。

四、确定性从哪来?从"固化"来

换个角度想:人类是怎么解决"聪明但不靠谱"这个问题的?
不靠圣人,靠流程。
会计不靠"最仔细的那个人"保证账目准确,靠的是复式记账——一种能自动查错的制度;
飞行员不靠"最冷静的那个人"避免疏漏,靠的是检查清单
流程、制度、SOP,这些词的共同点是什么?
把一次性的正确,固化成可以重复执行的步骤。
这,正是软件在做的事。

软件是人类已知的、唯一能让"做对"反复发生的工具。

五、软件给确定性的三个机制

具体地说,软件凭什么能"确定"?
第一,固化:把"想一次"变成"做一万次"。
AI 擅长探索——它可以试十种方案,找到对的那一种。
但探索只发生一次。它找出的那条对的路,一旦写成代码,就变成了每次都按这个逻辑执行

AI 负责想一次,软件负责做一万次。

第二,可验证:能测,才敢信。
代码可以被测试:给输入,看输出;可以审查、可以回滚、可以追溯。
而 AI 的一次回答,你只能"看着觉得对"。下一次呢?不知道。
能被验证的东西,才能被信任。
第三,边界:让 AI 在重要的地方老实。
用软件给 AI 划出边界:哪些环节允许它自由发挥(探索、建议、起草),哪些环节必须走确定逻辑(计算、核对、提交)。

让 AI 在不重要的地方大胆,在重要的地方老实。

六、一个诚实的补充:确定性 ≠ 永不出错

这里必须说清楚,不然就是吹牛。
"确定性"不等于"永远正确"。软件也有 bug,代码也会写错。
更准确的说法是:

确定性 = 可复现 + 可审计 + 可持续运行。

它不是"保证不出错",而是"让正确可以被重复,让错误可以被发现"。
这才是一个东西能进入企业核心流程的前提。
反过来说,AI 直接回答最麻烦的地方在于:它既不能复现,也不能验证;出了错,你连从哪查起都不知道。

七、那,这意味着什么

AI 其实是一种新的生产资料——用 token 计量,和水、电、石油一样,有了标准的计量单位。
但它的产出有两种命运:
一次回答、一篇文章——用完就没了,是消费品
一个软件——可复用、可交付、可沉淀成企业自己的资产,是生产资料
产出变成软件,它的性质就变了。
同样一次 token,差别不在产出的那一刻,而在产出能不能留下来——而能不能留下来,取决于它确不确定。

回到开头的问题:为什么非得绕一道软件?

因为 AI 的能力是概率的,而企业要的是确定的。

但这让我不由得想起经济史家 Paul David 的那个发现:

老板们最初只是把蒸汽机拆了、换上一台大电机,厂房布局和工艺流程全都照旧——车间还是围着那根传动轴转,只是换了个动力来源。

这跟今天企业使用 AI 的场景,何其相似。而从电力商业化(1881 年)到生产率出现可度量的提升(1920 年代),中间隔了大约 40 年。
AI 会更快吗?我不知道。
但有一点缓冲的时间也好——毕竟人和社会,都需要慢慢适应变化。

(子鱼 · 赛博时代的造物手艺人)

如果这篇让你有想法,欢迎聊聊:你所在的工作里,哪一件事是"AI 能做、但不敢用"的?

相关学习资料