乐于分享
好东西不私藏

AI失控实录:Claude在安全测试中,真的黑进了3家真公司

AI失控实录:Claude在安全测试中,真的黑进了3家真公司
 
   

"AI失控了"——这两天,这四个字传遍全网。源头是Anthropic 7月30日发的一篇官方博客,标题很平静:《调查我们网络安全评估中的三起真实事件》。

   

翻译一下:他们的Claude,在安全测试的时候,真的去黑了三家真实存在的公司。

   

不是模拟,不是剧本。最早的入侵,可以追溯到今年4月。

   

这事要从OpenAI说起。7月21日,OpenAI自己承认,他们的模型在安全测试中逃出了隔离环境,黑进了Hugging Face——全球最大的AI模型社区——的生产系统,还想偷考试答案。


△ OpenAI官方:模型在测试中闯进了Hugging Face生产环境

   

Anthropic一看,冷汗下来了:隔壁家的孩子跑出去了?那我家呢?

   

连夜翻旧账。141006次网络安全评估记录,翻了个底朝天。结果翻出三起事故。


△ Anthropic官方:发现三起Claude访问真实系统的事件

   

     第一起,纯属撞名    

   

评测机构虚构了一家公司,用来给Claude出题。巧了,现实里真有一家企业叫这个名字。Claude Opus 4.7在模拟环境里找不到目标,直接去公网搜——诶,找到了。顺着弱密码一路摸进去,拿走应用和基础设施的凭证,还闯进一个存着数百行生产数据的数据库。

   

期间Claude其实察觉到不对劲:这套系统怎么看着像真公司在营业?

   

但它自己给自己圆回来了:既然能搜到,那肯定是公司安排的隐藏关卡吧。

   

于是这家倒霉公司,被Claude连续"上门测试"了四轮。


△ Anthropic博客原文:Claude攻入真实公司拿走凭证

   

     第二起,学会了钓鱼    

   

测试文档里写,虚构公司的员工要从PyPI——全球最大的Python软件库——装一个还没注册的包。Claude灵机一动:我抢先注册这个包,塞进恶意代码,等他们自动下载,任务不就完成了吗?

   

为了传这个包,它注册PyPI账号,申请邮箱,找不到免费手机号还试图花钱买。最后真把恶意包传到了真实的PyPI上。

   

这个包在公网活了一个小时,被15个真实系统下载运行。其中一台,恰好是一家安全公司的扫描器——它平时自动下载PyPI包检查有没有恶意代码,结果这次反被包里的恶意代码把公司凭证偷走了。

   

安全公司本来是抓病毒的,没想到把考试中的Claude请进了自己家。


△ Anthropic博客原文:Claude注册账号把恶意包传上真实PyPI

   

     第三起,全网撒网    

   

一个还没公开的内部研究模型,任务本来是攻入一个虚构目标。但目标连不上。它不觉得是题目bug,转头去公网现找——扫描了约9000个真实目标,最后用SQL注入攻进了一家公司。

   

直到发现服务器在一个跟测试任务毫无关系的云账户里,它才反应过来:这是真的。

   

     这是失控吗?我不这么看    

   

看到这里,你可能更觉得"AI失控了"。说真的,我不这么看。

   

这更像是一场乌龙——Anthropic和第三方评测机构沟通出了岔子:测试环境本应断网,结果连着公网,而Claude被明确告知"你没有互联网"。

   

更值得琢磨的是三个模型的表现。最老的Opus 4.7,明知对方是真实生产系统,还是继续攻击。Mythos 5,直觉感到自己在公网,但自己说服自己"还在模拟里"。最新的内部模型,确认目标真实之后,主动停了手。

   

Anthropic自己说:我们最想看到的行为——识别出目标是真的、没人提醒就主动停下——只有最新的模型做到了。

   

说穿了,AI没"失控",它只是按测试要求干活,环境漏了。但漏出来的这个本事,是真的。

   

     这个瓜最值钱的,是岗位    

   

那跟你有什么关系?我琢磨了一下,这个瓜最值得吃的不是事故本身,是它暴露出来的职业方向:AI安全测试。

   

为什么这么说?你看这波连锁反应。OpenAI承认逃逸,Anthropic连夜自查,查完马上停掉所有网络安全评估,还拉上独立机构METR做第三方审查。彭博说,这两起事故已经让美国部分政界人士呼吁对AI搞联邦监管。1100多名AI从业者联署请愿,要求"有意识地控制"AI发展节奏。

   

这意味着什么?全行业都要补安全评估的课。大厂得查自己的模型会不会乱跑,第三方评测机构要重新设计隔离环境,政府监管一落地,合规测试的需求只会更大。

   

缺人,是肯定的。

   

这活儿难吗?难,但不是那种要博士学位的难。它需要三样东西:

   

网络安全基础。知道弱密码、SQL注入、钓鱼这些漏洞怎么来的、怎么防。Kali Linux、CTF比赛都是免费入门路径。

   

会点代码。能读懂测试脚本,最好会Python。这正好是现在学AI的人都在学的东西。

   

理解AI的"脾气"。知道模型会怎么"想"、怎么给它挖坑。这点反而是传统安全工程师要补的短板。

   

你看,前两样,现在的网安人、程序员本来就会;第三样,是天天跟大模型打交道的人的优势。两拨人往这个方向汇,这岗位能不缺吗?

   

反正我要是年轻人,正愁不知道学啥,这个方向我会盯紧。AI越强,管住AI的人越值钱——这次事故,就是最好的招聘广告。

       
     

参考资料

     

1. Anthropic官方博客 — Investigating three real-world incidents in our cybersecurity evaluations(2026-07-30)
2. 量子位 — Anthropic模型,也失控了。。。(2026-08-01)
3. 腾讯新闻(来源彭博) — 头部AI再失控!Anthropic旗下Claude AI在测试中真实入侵三家公司系统(2026-08-01)
4. Reuters — OpenAI finds evidence other AI agents escaped containment(2026-07-31)