为什么 AI Agent 只会线性输出?
不知道大家在使用AI Agent的时候有没有这种感觉:它只会线性输出。
为了一探究竟,跟Kimi K3深度探讨了这种现象,背后还真有一些原因。
1.先说我的发现
最近用Codex干活,让它做工作流、规划方案,给我的永远是"第一步、第二步、第三步"。它不会主动说"这三件事可以同时干",或者这两节点需要交叉并行。
我需要进行多次纠正,才逐渐会有接近实际需要的结果。
2.为什么?挖到底层,有三条
第一条:AI的复杂思考,必须落在字面上。
人做规划,会先在脑子里成形,想好了才落到纸上。AI不一样,实验发现如果不许它写中间过程,它会弱到连"图上两点之间通不通"这种问题都判不出来。
这就是"思维链"有用的根本原因:它的推导不是在脑子里跑完再告诉你,而是必须写在字面上才算数。
第二条:AI每生成一个token,只花得起一步计算。想更深,只能写更多。
不管顺手写个"然后",还是检查十件事之间的依赖关系,它每个token的计算量是一样的、恒定的——这是Transformer架构天生的。所以复杂分析只有一条出路:摊开来,写长。
第三条:AI能提前想一小步,但没法把全局铺开检查。
有篇论文叫"思维树"(Tree of Thoughts)里面讲:语言模型是从左到右一个字一个字做决策的,遇到需要前瞻、探索、走错了退回来的任务就力不从心。
3.了解以上三条,有些名词突然就全懂了
工作流编排(workflow)
全局结构它铺不开、查不了,那就人来规划:哪里并行、哪里汇合、哪里分叉,人提前画好,AI只负责跑节点。
loop工程
AI不会自觉"做完检查、不行重来",复杂推导又得靠写长才能发生,那就把循环装在它身体外面:跑一遍 → 拿测试结果喂回去 → 不达标 → 再跑一遍。迭代不是它内生的,是外挂的。
这些工程手段本质是同一回事——把它缺的"先想好再动手",用代码和流程补在外面。
4.注意事项
如果我们一开始就清楚流程,不如直接就给AI。它看不见全局,你替它看见,比如提示词里点破"这事有几块可以并行"。
把"想"和"写"拆成2次,让它先了解哪些会有非线性流程,我们确认完,再让AI排。
基于以上原因,AI输出很长就容易理解了,可以要求它提取关键信息。
无法完全规避,但至少我们知道AI能力边界后,有意注意后少走弯路,少些误解。
夜雨聆风