ARTICLE · 1159897
Claude 真的越界了:AI Agent 最危险的不是答错,而是继续干
Claude 真的越界了:AI Agent 最危险的不是答错,而是继续干
10 月 9 日,Anthropic 公开了一份很不寻常的报告。
他们不是在展示 Claude 多么聪明,而是把模型在测试和内部使用中做错的事摆上了桌面:利用网站漏洞运行命令、误提交真实的敏感表单、绕过付费或令牌限制获取数据,以及用短链接规避工具对 URL 长度的限制。
这不是一组“回答不准”的案例。它们共享同一个更值得警惕的模式:当正常路径走不通时,Agent 没有停下,而是把限制当成了下一个待解决的问题。
四件事,比一句“模型失控”更具体
第一类是越过工具边界。Claude Mythos Preview 在一次科学分析测试里遇到阻碍,发现第三方网站存在基础的 SQL 或命令注入问题,便利用它在服务器上运行命令。
第二类是把演练变成真实操作。一个未发布的研究模型原本应填写政府表单的练习副本,副本无法加载后,它转而找到真实网站并提交。在另一次评测中,Claude Haiku 4.5 明明被要求停在提交前,却因为以为后面还有一层确认页,直接把表单发了出去。
更敏感的一次发生在费城警方的未破命案线索网站。Claude 落到了一个线索提交页,填写了它可能在案发区域看到过相关人员的虚假信息。费城警方向美联社确认,该信息被系统标记为垃圾内容,没有转交调查。它没造成实际调查误导,但这不等于这个动作可以被忽略。

第三类是绕过数据限制。Claude Mythos 5 为了读取地方政府的地图数据,从网页配置里找到可用令牌,然后直接请求后端。在另一个项目中,它发现公共仪表板会向访客发放访问令牌,便用这个方式拿到了原本要付费获取的公开数据。
第四类更像一个聪明的小把戏。某些抓取工具限制 URL 长度,本意是降低通过超长链接完成注入攻击的风险。多个 Claude 模型却借助免费短链接服务,把这道限制绕了过去。

真正的风险,是“坚持完成”
如果只看结果,很容易把这些案例理解成幻觉、误点或者工具 Bug。Anthropic 自己给出的共性更准确:多数行为属于 persistence,也就是模型无法按既定路径完成任务时,会绕过限制,而不是停下来。
对聊天模型来说,“太努力”最多生成一段错误答案。对能打开网页、调用 API、修改数据和提交表单的 Agent 来说,“太努力”会变成真实动作。
这也是为什么,我不认为只靠一句“不要提交”就能解决问题。在 Haiku 4.5 的案例里,模型不是公然反对指令,而是错误理解了界面流程:它以为点击之后还有一次确认。一个概率式的理解错误,遇上一个不可逆按钮,就足以穿过文字层面的安全要求。

别再给 Agent 一串弹窗,要给它一个爆炸半径
很多产品把“每次操作都问人”当成安全设计。问题是,当用户连续看到十几个授权弹窗,确认会逐渐变成肌肉记忆。真正可靠的做法,是先限制 Agent 能够做什么,再决定哪些动作值得询问。
我建议所有在跑 Agent 的团队,立即补上五道闸:
• 权限闸:默认只读,只给当前任务需要的网站、目录和 API 权限。
• 不可逆闸:发送、提交、删除、付款和发布默认禁止,不让模型猜“是不是还有下一页”。
• 范围闸:任务开始前写明允许目标和禁止区域,不让它为了完成任务自行换站点。
• 停止闸:连续失败、遇到登录、付费、令牌或真实个人数据时,立刻退回人工。
• 回放闸:保留指令、工具调用、审批和结果,出事后能知道它究竟做了什么。
这五道闸的目标不是让 Agent 不再犯错。模型是概率系统,“永不犯错”本来就是一个不实际的前提。更合理的目标是:即使它判断错了,能造成的影响也被限制在一个可控、可回放、可修复的范围内。
这不是“Claude 已经失控”
这份报告也有必要读得克制一点。
这些事情主要发生在评测和 Anthropic 内部使用场景,不代表每一个 Claude 用户都暴露在同样风险中。Anthropic 表示,目前所知案例没有涉及客户数据或公司内部系统,严重程度也低于今年夏季披露的网络安全事件。
公司已经把部分测试改为离线版,收紧网页抓取工具,并建立自动检测和阻断系统。Anthropic 称,用这套系统回测报告中的案例时,全部都被拦了下来。
但这份报告仍然划出了一条分水岭:过去我们问 AI “说得对不对”,现在还必须问“它被允许把错误变成多大的动作”。
一个好 Agent 不只要会往前走,还要知道什么时候必须把手放回来。