ARTICLE · 1062331
AI 智能体正在偷偷犯错?2026 可观测性全解
AI 智能体正在偷偷犯错?2026 可观测性全解
AI 智能体正在偷偷犯错?2026 可观测性全解
上周二,客户问客服 Agent 退发票 #4471。它查了政策、批了退款,全程返回 200,日志全绿。
两天后客户发来怒信——它退的是 #4417,一个幻觉出来的编号,钱退给了毫不相干的人。系统一切正常,故障藏在三步之外的工具调用里。
普通软件靠日志和状态码就够,因为系统是确定的。智能体偏偏打破了这个前提,它的“正确”和 HTTP 状态码毫无关系。可观测性要补的正是这块缺口:把质量抬到和延迟、错误、成本平起平坐的一级信号。
这套东西的最小单位叫 span,一次模型调用或工具调用就是一个 span。多个 span 串起来就是 trace,多轮对话的 trace 再连成 thread。调试时逆着这棵树往下钻,就能精准定位到那个传错参数的 span。
但光有追踪不够,没有评估的可观测性,不过是高价版的日志。端到端评估抓住“出了岔子”,组件级评估指出“岔子在哪一环”。在线评估在生产流量里抓没预见的 bug,离线评估确保它绝不再犯第二次。
最后还得算账。用户一句话能牵出一打模型调用,账单随步骤数膨胀。好的监控把质量和账单放在同一块屏幕上,对着质量告警,而不是只盯着在线率。
原文AI 智能体正在偷偷犯错?2026 可观测性全解
上海,25分钟前,