过去一年,AI Agent 的讨论很热。
过去一年,AI Agent 的讨论很热。
一开始大家关心:
它能不能调用工具?
能不能自己规划步骤?
能不能帮我做完一件事?
现在问题变了。
真正要上线 Agent 的团队开始问:
它失败时,我怎么知道错在哪里?
它引用的证据从哪里来?
它为什么调用这个工具,而不是那个工具?
它是不是在循环?
它是不是把草稿当成了结论?
这就是 AI Agent 从演示走向生产时必须面对的问题。
今天这篇是一次小型工程深潜。
主题只有一个:
上线 Agent 前,先读懂一条 trace。
什么是 Agent trace
trace 可以理解为 Agent 的执行录像。
不是屏幕录像。
而是结构化记录。
一条最小可用的 Agent trace,至少应该记录五类信息:
用户输入:用户到底让 Agent 做什么
计划步骤:Agent 准备怎么做
工具调用:调用了哪些工具,传入什么参数,返回什么结果
证据来源:答案依赖哪些文档、网页、数据库、记忆或系统记录
最终输出:Agent 最后交付了什么,以及是否触发人工确认
如果没有 trace,Agent 失败时只能靠猜。
如果有 trace,失败会变成可定位的问题。
你能看到是输入不清、工具错用、资料过期、权限不足,还是模型自己跳结论。
为什么提示词不够
很多团队遇到 Agent 问题,第一反应是改提示词。
提示词当然重要。
但提示词只能定义意图。
它不能自动保证执行过程正确。
举个例子。
你让 Agent 做客户跟进。
提示词里写:
不要承诺价格。
但 Agent 实际执行时,可能先读了旧报价表,再生成邮件草稿,然后把草稿发到外部客户。
这时问题不只是提示词。
你还要知道:
旧报价表为什么被读到?
发送权限为什么开放?
草稿为什么没有审批?
工具返回的价格有没有时间戳?
最终输出有没有标记风险?
这些问题,提示词回答不了。
trace 才回答得了。
四类常见失败
第一类,证据失败。
Agent 找到了资料,但资料过期、不完整或不适用。
表现是答案很流畅,但依据错了。
第二类,工具失败。
Agent 调用了错误工具,或者用错参数。
表现是流程看起来跑完了,但结果偏离任务。
第三类,状态失败。
Agent 在多步骤任务里忘记前面约束,或者把临时结论当成最终结论。
表现是前半段合理,后半段跑偏。
第四类,权限失败。
Agent 做了它不该做的动作。
比如直接发消息、改系统字段、删除记录、提交表单。
表现是结果也许对,但动作越界。
这四类失败,都需要 trace 才能稳定发现。
执行溯源:答案背后的证据链
近期关于 Agent trace 和 execution provenance 的研究,强调一个核心问题:
Agent 的最终答案,应该能追溯到中间证据和动作。
这对普通企业有什么意义?
很简单。
如果 Agent 给出一个结论:
这个客户应该优先跟进。
你不应该只看结论。
你要看证据链:
它读了哪些客户记录
它引用了哪次会议内容
它有没有看到最新邮件
它是否考虑付款状态
它是否跳过了人工备注
如果证据链不完整,这个结论只能当建议。
不能进入正式流程。
最小评测闭环
中小企业不需要一开始就搭复杂平台。
但至少要有一个最小评测闭环。
第一步,保存 20 条真实任务。
这些任务来自真实业务,不要只用玩具案例。
第二步,定义通过标准。
比如答案必须引用来源、必须列出风险、不能越权发送、不能改价格字段。
第三步,保存每次运行 trace。
记录输入、工具、证据、状态和输出。
第四步,人工复盘失败样本。
不要只看成功率。
要看失败是证据、工具、状态还是权限问题。
第五步,把失败样本加入下一轮评测。
这样 Agent 会越测越接近真实业务。
小案例:客服 Agent 的 trace
假设一个客服 Agent 要回答客户:
我的订单为什么还没发货?
一条合格 trace 应该长这样。
输入:
客户询问订单发货状态。
计划:
先查订单号,再查库存,再查物流规则,最后生成回复草稿。
工具调用:
查订单系统,返回订单已付款。
查库存系统,返回某 SKU 缺货。
查物流规则,返回缺货时需要人工确认预计发货日。
证据来源:
订单系统时间戳、库存系统时间戳、物流规则版本号。
输出:
生成客服回复草稿,并标记“预计发货日需人工确认”。
如果 Agent 直接回复客户:
明天一定发货。
那就是权限失败和证据失败。
它没有预计发货日依据,也越过了人工确认线。
生产级 Agent 的三条底线
第一,不能只看最终答案。
必须看执行过程。
第二,不能只靠一次测试。
同一任务要多次运行,观察稳定性。
第三,不能只把评测放在上线前。
生产中的失败样本,要回流到评测集。
这就是为什么 Agent 评测比提示词更重要。
提示词解决“我希望它怎么做”。
评测解决“它实际有没有做到”。
trace 解决“没做到时错在哪里”。
结论
AI Agent 真正进入生产,不是因为它会调用工具。
而是因为它能被观察、被评测、被追责、被改进。
未来的 Agent 工程,会越来越像一套新的运维体系。
不是只有 prompt。
还要有 trace、eval、policy、approval、rollback。
对中小企业来说,不需要一开始追大平台。
但至少要从今天开始保留执行记录。
一个不能复盘的 Agent,不应该自动化关键业务。
一个能留下证据链的 Agent,才有机会长期可靠。
如果你准备上线任何 AI Agent,先别只调提示词。先要求它留下五类 trace:用户输入、计划步骤、工具调用、证据来源、最终输出。后面我会把这套方法继续拆成中小企业 AI 自动化课程里的 Agent 评测与风控模块。
夜雨聆风