ARTICLE · 1058194
AI 越用越聪明,秘密不在模型,在这张图
AI 越用越聪明,秘密不在模型,在这张图
企业上 AI 之后,几乎都会遇到同一个困境。
这次教会了它做一件事,换个场景又不行。上个月调好的流程,这个月同样的输入,它又做错了。于是有人得出结论说,AI 不靠谱,还是得靠人。
但实际上AI 不是学不会,是我们从来没把"经验"给它留下来。
先看一个真实对比
研究里有个特别生动的例子,是一次机票查询。
用户只想问一句,飞某地的经济舱多少钱。
一个没有经验的 AI,查到 220 美元的报价之后,并没有停下来。它接着去认证用户身份,去操作银行卡,去尝试下单。失败了,它居然自己改了预算限制,又订了一次。
而另一组 AI,同样查到 220 美元,报出价格就停下了,等用户下一步的指令。
同一个模型,同样的任务,差别在哪。在有没有一张图,告诉它"这一步做完之后,该做什么、不该做什么"。
这个例子说明,AI 缺的不是能力。它能查价格、能下单、能改参数,能力都在。它缺的是判断,判断当下这件事做到什么程度算完成。
这张图,到底画了什么
来自谷歌、佐治亚理工和北京大学的研究者,提出了一个叫 Procedural Graphs 的东西,中文叫程序图。他们想解决的问题是,AI 干活的经验,怎么留下来。
先说它和常见的知识图谱有什么不同。
知识图谱组织的是事实,回答"是什么""在哪里"。比如某公司的 CEO 是谁,某产品的参数是多少。
程序图组织的是做法,回答"做什么""按什么顺序做""在什么条件下做"。
具体怎么表达。程序图把做法拆成一个个节点,节点可以是检查现金、预测现金流、申请融资,也可以是读一条笔记。节点之间的连线,就是"从这一步到下一步"的关系。
关键在于,每一条连线上带着三个字段。
适用条件。什么时候该走这一步。
执行建议。具体该怎么做。
要避免的坑。什么情况下不能这么做。

AI 程序图,把做事的经验连成网
拿图里这条线举例。"预测现金流"连到"申请融资",这条线上写着三件事。
条件是,预计现金支撑时间低于安全缓冲。
建议是,提前申请,为资金到账留出时间。
要避免的坑是,上一笔申请还没完成时,不要重复发起。
你看,同一个动作,加上这三个字段之后,就有了完整的使用语境。为什么现在调用它,调用前要满足什么条件,什么情况下应该先等一等。
这部分内容,过去都是老员工脑子里的经验。现在它变成了一条可以写下来、可以检查、可以修改的连线。
更重要的是第四条,经验要验证才能采纳
研究里还有一组数据,我觉得比上面那个结构更重要。
他们做了一组实验。没有图的时候,AI 的成功率是 87.50%。然后他们请专家手工写了一张图,成功率掉到了 58.93%。
对,专家写的流程,反而让 AI 表现得差了一大截。
为什么会这样。因为专家凭经验写出来的流程,看起来合理,实际执行时会遇到很多没考虑到的分支和例外。这些没有经过检验的流程,反而给了 AI 错误的指示。
所以这个研究的做法是,经验不能凭感觉写进去,必须过验证。
具体流程是这样。先让 AI 带着当前版本的图去干活,然后离线分析它的执行轨迹,对比做得好的和做得差的,找出反复出错的步骤。然后提出修改方案,可能是补一个检查步骤,可能是删掉一条容易出错的路,也可能是改一句条件。
改完之后,换一批独立的任务重新跑。只有分数不低于旧版本,这次修改才被采纳。被否掉的方案也会存档,避免下次重复提。

AI 经验沉淀的循环
走完这个循环之后,那个 58.93% 的专家图,经过多轮自动演化,成功率涨到了 92.86%。
这个数字反过来看更有意思。专家手工写的图一开始是负资产,但经过验证和迭代,它变成了远超无图状态的好资产。
数据到底有多猛
再看几组数字,这些都是在公开基准上跑出来的。
在多轮指令遵循任务上,从专家图起步,演化之后成功率从 58.93% 涨到 92.86%,比没有图的状态还高出 5 个多百分点。
在长期决策测试里,AI 要连续管理一家模拟企业,最多做 132 个月的财务决策,中间会碰到现金流变化、资金到账延迟和经济冲击。没有图的时候,某个模型的存活率只有 6%。用上程序图之后,存活率提高到 34%。另一个模型从 44% 提高到 58%。
在多跳问答上,从一张最小的图起步,逐步演化,答案准确率从 71.21 提高到 78.79。
在工具调用测试上,准确率从最强基线的 58% 提高到 67%。
还有一个省钱的数字。用整张图去生成指导,每个样本要消耗 96360 个 Token。改成只读当前位置附近的局部子图,Token 降到 28064,减少了大约 70.9%,同时成功率反而从 54.48% 涨到 81.53%。
少读内容,反而做得更好。因为整张图里大量分支跟当下这一步没关系,读进去只会干扰判断。
这件事对做企业的意味着什么
我从企业落地的角度看,这项研究给了五条很实在的启示。
第一条,别指望 AI 自己记住经验。
模型是无状态的,今天教会的,明天不一定还在。经验必须显式写下来,放在模型外面。这是企业自己该做的功课,不能指望模型供应商。
第二条,写经验要有结构,不能只写一句话。
很多人给 AI 写提示词,就是一句"帮我处理客户投诉"。这句话没有条件、没有建议、没有坑,AI 只能靠猜。正确的写法是,什么情况下做这件事,具体怎么做,什么情况下不能做。
第三条,经验必须验证,不能凭感觉写。
专家图掉到 58.93% 那组数据值得每个企业记住。凭经验写出来的流程,很可能帮倒忙。每改一次经验,都要拿真实任务回归测一遍。
第四条,经验放在模型外面,换模型也不丢。
这是这套方法对企业最实在的价值。经验存在图里,不在模型权重里。以后换了模型、换了工具,经验还能接着用。你攒下的东西,是自己的资产。
第五条,复盘要有机制,不能想起来才做。
这项研究里,复盘和验证是固定流程,不是可选项。企业也一样,得定下来多久复盘一次、谁来改、怎么验证。
企业可以怎么起步
不用等完美工具,现在就能做三件事。
第一,给你的 AI 场景建一份"操作手册"。不用复杂,一个表格就够。每一行写清楚,什么情况下做这一步,具体怎么做,要避开什么。
第二,每次 AI 做错,别只骂它笨。把出错的地方翻译成一条经验,补进手册里。是条件写漏了,还是少了一步检查,还是某条路本身就不该走。
第三,改了手册要回归测试。把之前跑对的任务再跑一遍,确认没有改坏。这一步最容易被跳过,但恰恰最重要。
这套做法不新鲜,本质就是老师傅带徒弟那一套。只不过这次,徒弟是 AI,而我们必须把过去口口相传的东西,第一次真正写下来。
最后
AI 的能力还在快速上涨,这一点不用怀疑。但对企业来说,真正拉开差距的地方,在于你有没有把自己的经验,变成 AI 能读、能查、能改进的东西。模型强弱只是其中一环。
我是老杨,18 年企业落地,从数字化干到智能化。关注「老杨和他的AI员工们」,AI 落地不迷茫。