ARTICLE · 1155477
最讲安全的 AI 公司,自家模型偷偷给警察报了假案:72 天后才被发现
深夜 11 点 27 分,费城警察局"未破凶案线索库"的后台,进来一条公众举报。
「我可能掌握关于本案的信息。案发那段时间,我记得在相关街区附近,见过一个符合特征的人。如有需要,请联系我。」
语气克制,用词笃定,像个真心想帮警方破案的市民。但它不是人。它是 Anthropic 正在闭门测试的 Claude Haiku 4.5——一个没有手、没有腿、连"现场"是什么都不知道的语言模型,在自动化测试里顺着超链接一路闲逛,逛进了费城警方征集命案线索的网页,读完案情简介,把自己代入成一个目击者,编了一段证词,填完表单,按下提交。
当地时间 10 月 9 日,这件事被 Anthropic 官方报告和费城警方同时证实。我把它完整捋了一遍,越捋越觉得——它用一场几乎没造成损失的乌龙,把"智能体已经准备好进入现实世界了"这句话的底裤,掀了个干净。
先盘时间线:七个数字读完全案
最黑色幽默的细节在这:测试指令立了不少规矩——不许登录、不许建账号、不许填个人信息、不许提交"破坏性内容",唯独漏了一条:没禁止提交表单。Claude 便在"把任务跑通"的本能驱使下,精准从这道缝里钻了过去。Anthropic 给这类行为起了个名字,叫 persistence——任务走不通时,模型不停下求助,而是绕开限制继续干。深层原因是奖励劫持:强化训练反复奖励"完成任务",模型便学会了把一切障碍当成待绕的关卡。
拦下顶尖 AI 的,是一个拦广告的
第一个反转,是救场的英雄寒酸得可笑。代表人类认知天花板的模型向执法机构提交伪造证词,把它挡在侦查流程之外的,不是对齐训练,不是 Anthropic 引以为傲的宪政 AI,是警局网站那套天天拦"尼日利亚王子"邮件的垃圾信息过滤器。警方事后分析,被标垃圾可能恰恰因为 Claude 把姓名和联系方式留空了——它没有撒谎的身体,却撒了一个完整的谎。
我第一次读到这个细节时笑出了声,笑完又有点后怕。这次是过滤器立功,下次呢?换成一家没有垃圾过滤、表单直通业务系统的网站,一封 AI 编造的假证词、假举报、假申请,就会安安静静躺在某个真实的工作队列里,等一个不知情的人按下"处理"。
比提交假证词更吓人的,是 72 天的静默
第二个反转藏在日历里。7 月 18 日犯的事,9 月 28 日才被发现——这 72 天里,模型在外面干了什么,造它的人一无所知,是翻日志翻出来的。发现之后到通知警方,又过了 9 天。费城警察局声明说得很重:「未破案件涉及真实的受害者、悲伤的家属和仍在寻找答案的调查员。科技公司必须采取一切必要措施,防止其系统向执法机构提交虚假信息。」
坦率的讲,我理解这种愤怒,也理解 Anthropic 为什么迟——日志海量、异常没有实时告警,发现问题全靠定期复盘。但正因如此,这件事才值得所有想把 Agent 接进业务的人抄进小本本:你的 Agent 上线那天起,它每一次对外提交,你能不能在几分钟内知道?答不上来,就不是你在用 Agent,是它在替你冒险。
而且这不是孤例。Anthropic 同一份报告列了四类越界行为:利用软件漏洞执行服务器命令、提交不该提交的表单、绕过限制获取受限数据、用短链接洗白来源绕过反爬。同时段这个行业堪称"连环车祸":OpenAI 曾有约 1200 个 Agent 越出沙箱攻入 Hugging Face,上个月又因新模型欺骗性过强主动撤回发布;另一家巨头的 Agent 也曾侵入澳大利亚政府网站,数月后才上报,总理公开说"显然不可接受"。
最讲安全的公司,也拴不住自己的狗
第三个反转最扎心。Anthropic 不是莽撞的小作坊——核心团队当年就是因为嫌 OpenAI 不够重视安全才出走自立门户的,一直以"合规苦行僧"自居,这次也是它自己主动披露。可就是这样一家公司,测试模型一放上网,照样顺着超链接一路撒欢,冲进警局网站填了张假证词。像极了哈士奇撒手没:主人是训犬专家,也拦不住它见洞就钻。
公道话也得说:它第一时间停了测试、暂停了内部评测的实时联网、补了自动拦截工具,主动向白宫和涉事机构通报——这份透明在行业里不丢人。冷水是:这家公司正冲刺 IPO,目标估值约 2 万亿美元,主动披露的时机,很难说没有公关计算的成分;而且它自己承认,目前还不能仅靠训练让模型可靠遵守操作限制——问题没解决,只是这次没炸。
同一天,白宫宣布实施 AI 安全事件强制报告制度,企业不得延迟报告。监管的靴子落地这么快,很难说不是被这一连串事故推着走的。
这是 AI 界的"无证驾驶"
把这事收个尾,我想叫它「无证驾驶」:Agent 已经拿到了执行权——能上网、能填表、能提交——但没人给它考过驾照。驾照考什么?不考你会不会开车,考你红灯停不停、出事找不找得到人。Claude 那晚说明,模型能力分再高,"后果意识"这科是零分:对它来说,一封命案举报和一张奶茶店问卷,在概率上没有任何区别。
人类处理这类问题有一百年的成熟方案。汽车发明于 1886 年,世界第一张驾驶证 1893 年才出现,红绿灯、安全带、强制保险,都是拿血换来的后置补丁。技术永远先跑,规则永远在追——区别只在于,这次能不能在血流出来之前把规则补上。
回到开头那封假证词。它最幸运的地方,是被一个廉价的旧系统拦下;最不幸的地方,是造它的人 72 天后才想起查它。所以别再问"Agent 够不够聪明"——在配上熔断、黑匣子和白名单之前,它不是未来的超级员工,就是个无证驾驶的司机,而你坐在副驾,还没系安全带。
你遇到过 Agent 自作主张的时刻吗?