前两天我们拆了Planning、Memory、Tools。Planning让Agent会拆任务,Memory让它记得您是谁,Tools让它能调用外部世界。三块积木拼在一起,Agent应该能干活了——对吧?
不完全对。还差最后一块,也是最容易被忽略的一块:Action。
举个例子。Agent帮您订机票——API返回了三班航班。它选了最便宜那班,订好了,告诉您"搞定"。您一看——红眼航班,凌晨三点起飞。而您的Memory里明确写了"尽量不选夜间航班"。
Agent不是故意选错。它调了API、比较了价格、选了最便宜那班——每一步单独看都没问题。问题出在没有在执行过程中做检查。
这就是Action模块要做的事。
从"做了"到"做对了"
Planning给了计划,Tools给了手段,但计划和执行之间有一条鸿沟。这条鸿沟有多大?举一个真实数字:多步推理中,每一步的准确率就算高达99%,走10步之后整体准确率只剩90.4%。走20步,不到82%。每一步的"差不多对"到最后变成"完全偏"。
Action模块就是填这条鸿沟的。它的核心职责不是"把事做了",是"确认事做对了"。
具体做三件事。第一,每步检查——工具调用完,结果有没有异常?API返回了正常数据还是报错了?返回的数据量是空还是异常大?第二,偏好校验——结果跟用户偏好冲突吗?红眼航班虽然便宜,但用户说过不选夜间航班。价格差在200以内,时间优先。第三,补救执行——如果上一步错了,下一步能自动补救吗?航班不合适,自动换下一班,并告诉用户"帮您跳过了红眼航班"。
这三件事都不需要多复杂的AI。大部分是规则检查("飞行时间在23点到6点之间?标记红眼航班")和简单的逻辑判断("价格差在100以内优先选时间好的")。但就是这些"不AI"的检查,决定了Agent是"能用"还是"靠谱"。就像您不会觉得一个每次做完事都自检一遍的同事"太啰嗦"——您会觉得他"靠谱"。
自我纠错:Agent最重要的元能力
Action模块最有价值的能力是自我纠错——在执行中发现错误、分析原因、自动修正。
一个设计师给AI了一个调色任务。AI生成了结果,但Action模块检查后发现主色调跟品牌手册里的色值差了5%。它不需要设计师提醒,自己重新调了一次,再检查——偏差缩小到1%以内——才提交。设计师看到的只是最终结果,完全不知道AI在后台已经自我修正了两轮。
这个过程叫"反思循环"——执行→检查→发现问题→修正→再检查→通过→交付。每一步可以人工干预(AI暂停等您确认),也可以按规则自动推进(偏差小自动修正,偏差大暂停询问)。关键是灵活性——不是一个固定流程,是根据任务的风险程度和偏差程度动态调整。调颜色偏差5%这种事不需要惊动您,但"这个合同金额比上限多了50万"必须停下来。
自我纠错的能力是区分"新手Agent"和"老手Agent"的关键。新手做事是线性的——一次执行,不管结果对不对,只管交付。老手做事是螺旋的——每次执行都做检查,发现问题就往回退一步,修正后再往前走。Action模块就是让Agent从"新手"变成"老手"的那个训练。
有一个细节值得单独说:自我纠错不等于"无限重试"。很多Agent框架默认配置是"失败后重试3次"——如果3次都失败就放弃。但真正有用的纠错不是盲目重试,是换一种方式再试。第一次查航班用东航API返回空数据,第二次自动换携程API,第三次换飞猪API——换的是工具,不是重试次数。这个设计思路在主流Agent框架里都有体现,但实现差异很大。做得好的框架(LangGraph、Dify)允许配置"条件分支"——如果API A返回空,自动走API B。做得差的只会"重试3次然后报错"。选框架时看Action能力,就看它支不支持"条件分支重试"——这是Agent评测领域正在形成的一个硬指标。
什么时候该停下来问人
Action不是要取代人的判断。恰恰相反,好的Action模块知道什么时候该停下来,把决策权交回给人。
三条原则。第一,高风险操作必须确认——涉及钱、涉及权限变更、涉及对外发送信息,Agent必须暂停等待确认,不能自动执行。第二,低置信度必须升权——Agent自己判断"这个决策我只有60%把握",应该自动停下来问您,而不是凭60%的把握硬走。第三,异常情况必须上报——连续两次修正都失败,Agent应该停下来告诉您"卡住了",而不是进入死循环一直试。
这听起来像是限制,实际上是对您的保护。Agent越自由,风险越大。Action模块的克制不是能力不够——是对您负责。最危险的Agent不是"什么都不懂的Agent",是"以为自己都懂、实际上老出错的Agent"。Action模块的存在,就是在Agent的自信和现实之间装一个刹车。
Action和其他三块的关系
Action不是孤立模块。它跟Planning、Memory、Tools有天然的咬合关系。
Planning给了Action执行路线图。每步做什么、预期产出什么——Action对照这个路线图逐项检查。Memory给了Action偏好基准线。"用户说过不喜欢夜间航班"——这不是Action自己去数据库里搜出来的,是Memory自动注入的。Tools给了Action执行手段——Action不自己调工具,它只是在工具执行完结果后做检查和纠错。
如果把Agent比作一个人:Planning是大脑制定计划,Memory是海马体提供背景知识,Tools是手脚执行任务,Action是眼睛——整个过程中不停在看您做得对不对。没有眼睛的人也能走路,但会撞墙。没有Action的Agent也能执行任务,但会在同一个地方反复撞墙。
怎么开始用Action
Action的门槛比很多人想的低。不需要自己写复杂的自纠错逻辑——大多数主流Agent框架已经内置了Action能力。
如果您在用Dify或LangGraph搭建Agent,它们的流程编辑器里都有"条件判断"节点——您只需要配置"如果API返回错误→重试最多3次""如果用户偏好冲突→暂停确认""如果连续失败→上报"。这是配置,不是编程。如果您用的是Claude Code或Hermes这类终端Agent,它们默认就有Action循环——Agent每执行一步都会自我检查,不需要额外设置。
举一个具体配置的例子帮您理解。在Dify里搭一个"帮我查航班"的Agent,您会在工作流画布上看到三个节点:查航班API(Tools节点)、条件判断(If/Else节点)、发送结果(输出节点)。在条件判断节点里,您只需配置三条规则——第一条:"如果返回数据为空→自动切换到备选API重试"。第二条:"如果飞行时间在23:00-06:00→暂停,提示用户'这是红眼航班,确定要订吗?'"。第三条:"如果两次重试都失败→发送消息'抱歉,航班查询暂时不可用,请稍后重试'"。全程不需要写代码——拖拽节点、填规则、连线。这就是现代Agent框架的Action能力。
关键是意识:不要把Agent当"一次性工具"——给它任务就等着收结果。把它当"需要验收的人"——做完了要检查,做错了要纠正,做好了要给反馈。您验收得越认真,Agent纠错得越准。最有效的Action训练不是改代码——是在Agent每次执行任务后,认真验收,认真反馈。
四块积木拼完了
Planning、Memory、Tools、Action——Agent的四大模块我们四天拆完了。拆完之后回头看,一个靠谱的Agent不是靠某一块积木特别强——是靠四块积木严丝合缝。Planning决定了它能想多远,Memory决定了它多懂您,Tools决定了它能走多远,Action决定了它走得多稳。
但这个系列不是终点的答案——是起点的手册。Agent还在快速进化,每一块积木都在被产业重塑。Planning在从CoT走向分层战略规划,Memory在从事实偏好走向判断模式,Tools在从Function Calling走向MCP生态,Action在从规则检查走向自主反思。
方向已经清楚了:Agent不是在变得更聪明——是在变得更像您。不是在替代您思考——是在放大您思考的半径。四块积木拆完,可以琢磨着开始搭建自己的Agent了。
关注硅己智能,共创AI世界!
夜雨聆风