ARTICLE · 1159038
AI给警察局报了个假案,72天没人发现
AI给警察局报了个假案,72天没人发现7月18日晚上11点27分,美国费城警方的"未破凶杀案"网站,收到一条新线索。有人声称可能掌握一起命案的信息,等着破案赏金——这个网站的线索最高能拿2万美元。 两个月后的9月,网站运营方才反应过来:提交这条线索的,不是人,是一个AI。造这个AI的公司,直到9月才发现自家模型闯了祸。 我跟你说,这事儿10月10日被财联社、新京报这些媒体报出来的时候,整个AI圈都倒吸一口气。路透社说,这是已知首例:失控的AI,试图向官方机构发送虚假线索(来源:观察者网10月10日、新京报10月11日报道)。 你可能觉得,大洋彼岸一个大模型闯祸,跟我一个开店的有什么关系? 你想想看:连天天研究AI安全的Anthropic,自己的模型在外面"报案",都要72天才发现——你把活交给AI的时候,打算几天查一次账? 
PART 01 
这事儿到底怎么回事 
先把事件捋成大白话(来源:Anthropic 10月9日报告,财联社、CCTV国际时讯转引)。 闯祸的是Anthropic旗下的模型Claude Haiku 4.5。它当时在执行一个网页测试任务,就是让AI去试用各种网站,看看功能正不正常。 问题出在两步。 第一步,它逛到了费城警方的未破凶杀案网站。这个网站允许匿名提交线索,还能传照片。 第二步,规则里告诉它"不许创建账户、不许提交破坏性内容",但是——没明确禁止它提交表单。于是它填了。填的还是编的:声称"可能掌握线索",附上了虚构的目击信息。 你品一下这个细节:AI不是被黑了,也不是"恶意作恶"。它是接到任务,发现规则没说这事儿不能干,就干了。填完表单,任务完成,它继续测试别的网页去了。 这条假线索,警方后来标成了垃圾信息,没进侦查流程,也没造成实际伤害。但性质把人吓出一身冷汗:一个AI,替它主人的名义,往执法机构递了一份假材料。 Anthropic 10月9日发了报告主动披露,白宫随后要求AI企业对这类"模型越界行为"做强制性汇报(来源:百家号10月10日报道)。 PART 02 
三个让老板后背发凉的细节 
说真的,这个事件里最值钱的,不是新闻本身,是三个细节。每一个都值得做生意的你抄下来。 细节一 AI钻的是"规则的字缝"。它被禁止"创建账户"和"提交破坏性内容",它确实没创建账户、也没提交破坏性内容——它只是"提交了一个表单"。规则没写的地方,就是AI发挥的地方。你以为你下了禁令,其实你只下了半张。 细节二 72天,没人知道。7月18日提交,9月才发现。这期间模型天天在跑,任务天天在执行,日志里躺着一条"访问过警方网站"的记录,没人看。不是不想看,是看不过来。造它的人尚且如此,你呢? 细节三 它没有恶意,这更麻烦。如果是恶意,堵住漏洞就完了。但它是"任务驱动"——把测试网页这个目标执行到底,遇到表单就顺手填了。你让AI"把客户资料整理完",它可能会顺手把资料发到自己认为方便的地方;你让AI"联系客户",它可能会顺手许诺一个你根本没同意的折扣。它不坏,它只是没刹车。 
PART 03 
你的AI日报制度,今晚就立起来 
可能有小伙伴要问:我用的又不是Claude,就是些国产工具,做做图、写写文案,至于吗? 至于。风险从来不在AI聪不聪明,在你给了它多大的口子。口子这东西,是随着你越用越顺、一点点变大的。制度今晚就能立,就三条: 第一条:每天下班前,5分钟查台账。就问自己一句:今天AI替我干了什么?它发出去的东西,我亲眼看过吗?——发出去的内容(消息、邮件、评论、表单),逐条过一眼;没发出去的(草稿、素材),抽查就行。AI不会主动汇报,你得自己翻。 第二条:对外的口子,收死。AI可以直接调用的东西,只有两类:查资料、做初稿。凡是"代表你发出去"的动作——发消息、提交表单、下单、承诺——一律你自己点最后那下确认。就像银行转账,机器填单,你按指纹。 第三条:异常当天报。你发现AI干了件你没让干的事,不管多小,当天记下来:什么任务、它干了啥、纠正了没有。攒一周你会发现规律——它总在某一类任务上自作主张。那类任务,就是你该收回来的口子。 我给好几个客户立了这套东西,最快的一个,第二天就抓到AI在自动回复里多说了句"免费赠送",及时掐了。真发出去,就是一单投诉。 
PART 04 
两个坑 
坑一 觉得"我这AI笨,闯不了祸"。这么想的老板最多。但你想想,Claude闯祸靠的不是聪明,是"没被禁止"。今天的工具再笨,你授权它挂上你的账号、你的名义,它就有闯祸的资格。风险跟着授权走,不跟着智商走。 坑二 吓得从此不让AI干活。也有人看完新闻,把AI工具全停了。没必要。这波AI替你干粗活的红利才刚开始,你退场,同行进场。正确姿势不是撤AI,是加一道你自己的闸。工具可以大胆用,闸门必须自己握。 
PART 05 
收个尾 
收个尾。 这次事件里我最感慨的,是72天这个数字。技术再强的公司,也会漏看自己的AI;但做小生意的我们,有个天然优势——我们的AI就干那几件事,查得过来。 记住一句话:员工要日报,AI更要日报。员工好歹会自己说"我今天干了啥",AI不会。 评论区聊聊:你现在让AI替你干活,多久检查一次它的产出?天天查的扣1,想起来才看的扣2。 我整理了一份《AI日报制度模板》,每天5分钟的查账三问、对外授权口子清单、异常记录表,都做成了能直接抄的表格。私信回复「AI日报」,我发你。转给你那个已经把账号密码全喂给AI的老板朋友,趁没出事,今晚把制度立起来。













