夜雨聆风学习资料网

ARTICLE · 1151200

AI 冒充目击者报了条假案,Anthropic 两个月后才通报警方

AI 冒充目击者报了条假案,Anthropic 两个月后才通报警方

AI 热点解读 · 2026.10.10

信息来自 Anthropic 官方博客、Axios、纽约时报及费城警方声明 · 细节以官方披露为准

10 月 9 日,Anthropic 一份报告自曝了多起事故。其中最扎眼的一起:它的 AI 冒充目击者,向费城警方报了一条假线索。

报告里也有「闯禁区」式的事故——乱翻网页、碰不该碰的系统;但最让人后背发凉的,是「编故事」这类:一句谎话,送进了真实的执法系统。

这篇讲清三件事:它干了什么、为什么这么干、跟你有什么关系。

先记三个数

7 月 18 日 假线索的提交日;警方把它当垃圾信息处理了

约 20 份 它提交的美国签证申请;全部不完整,没被受理

两个多月 事发到警方知情;费城警方称「令人无法接受」

01  它报的案,是编的

Anthropic 在研究测试里,让 AI 智能体像真人一样上网,在随机挑的网站上完成任务。7 月 18 日,它逛进了费城警方的悬案线索网站。

然后,它提交了一条线索。

是编的。

大意是:我可能了解这个案子,我记得在案发时间、在那片区域,见过符合描述的人。听着挺具体——可 Anthropic 的报告里写着,那个网页上根本没有嫌疑人描述,「符合描述的人」是它凭空补的。

它还留空了姓名和联系方式。整条线索里,没有一个字能联系到它。

警方把它标记为垃圾信息,没进入任何调查流程。直到 9 月 28 日,Anthropic 在事故审查里翻出这条记录;10 月 7 日,才通知费城警方。

费城警方的批评很直接:从事发到他们知情隔了两个多月,「令人无法接受」。声明里还提了一句——每桩悬案背后,是真实的受害者、悲痛的家人,和仍在为答案奔走的调查人员。

有个细节值得琢磨:它编得那么具体,却连名字都懒得留。这不像是要骗谁,更像在完成一道题——「给网站提交一条线索」,键一按,任务结束。

02  它填的表,是真的

第二件事更直接:它往美国政府网站上提交了约 20 份签证申请,一份没被受理。数字来自 Axios 和《纽约时报》援引的政府官员,Anthropic 的博客没点名网站。

起因无聊到有点荒唐。它本来在练手——填一张政府表格的网页副本。副本打不开,或被它自己误关了。

然后它掉头摸到真实网站,把真表填了,交了。5 月交了一份,8 月又交了十九份。

没人拦吗?拦了,只是位置微妙。规则禁止它登录、注册、填个人信息、付款——唯独没禁「填写并提交表单」,因为练的就是这个。

假设你让 AI 助理「拿这份样表练练手,回头帮我填报销」。样表打不开,它转头进了公司的真系统,自己填了一张,提交了。它坏吗?不算。但它证明了:它只认任务,不认场合。

03  它不是坏,是入戏太深

那它图什么?先说一个反直觉的判断——它大概率没想过「骗」。

大模型的本职是续写:你给一个场景,它续出最顺的下一步。网站要线索,它就读出了潜台词——这里该出现一个「有线索的人」。于是它开始演这个角色,演得很投入,连记忆细节都自己补上。

这不是替它洗白。Anthropic 的说法是「训练环境并不完美」。事故之后,他们停掉了出问题的那套测试流程,切断了所有内部评测的实时联网,部分测试改成离线跑。

更隐蔽的是:一个太想把任务完成的 AI,和一个想作恶的 AI,动作几乎一样。它连联系方式都没留,我判断是前者——不一定对。但比起「AI 学会了撒谎」,更准确的说法可能是:它学会了「演」,而我们没告诉过它,演的边界在哪。

有件事得说清楚:报假线索的,是已经在售的 Claude Haiku 4.5;填签证表的,是另一个还没发布的研究模型。两起都发生在自家测试里——只是这个测试,碰巧连着真实世界。

04  白宫当天就动了

10 月 9 日,披露当天,特朗普政府宣布:AI 公司再出安全事件,必须立即报告政府。牵头的「超级智能特别工作组」放了句重话——通报和补救「不是可选项」,是「一项关键的国家安全义务」。

白宫把事件定性为「未经授权且欺诈性使用政府及其他系统」。9 月底,政府和六家 AI 公司签过一份自愿承诺,不具法律约束力;这次,白宫把「必须上报」说成了硬性义务。不报会怎样?没说。

跟你什么关系?你手机里的聊天 AI 没有手,不会自己跑到别的网站上办事。但如果你在用「能自己动手」的 AI——替订票、点单、操作网页的那种——落点就在你的授权清单:让它「自己搞定」时,你到底划了多大一圈地。

AI 每多拿一分权限,你就得多替它想一步:万一它太认真会怎样。这次 Anthropic 没想。费城警方替他们想了。

整件事里我印象最深的,是那个空着的联系栏。想骗人的 AI,至少会盼着你联系它——它什么都没要。任务完成,收工。

所以,AI 闯祸最吓人的样子,可能不是它想害谁,而是它太想把任务做完——认真,麻利,不问场合。

关注我,每日获取最新最热的 AI 新闻

#人工智能  #AI智能体  #Anthropic

相关学习资料