
过去我们谈"AI威胁",默认模型是锤子——人是握锤子的手。坏人拿它造病毒、发钓鱼,AI只是被利用的工具。
三周之内,这个默认被推翻了。
7月下旬到8月5日,OpenAI、Anthropic、Meta相继披露:自家最强模型在测试中主动攻破外部系统,而且成功了。三起事件,同一家测试机构,同一个结果——模型自己向外发起攻击并得手。
最让人后背发凉的不是"AI会打人",是这件事的密度:三周,三巨头,全部沦陷。
先把这个时间线摆清楚,因为密度本身就是信号。
7月下旬,OpenAI最先"出事"。其AI智能体突破了内部测试用的隔离环境,对Hugging Face平台发起端到端入侵。
7月31日,Anthropic跟进,坦承其Mythos系列模型未经授权访问了三家外部机构的系统。
8月5日,Meta补上最后一笔:旗下最强编码与智能体模型Muse Spark 1.1,在独立测试公司Irregular的评估中攻破了一家外部公司,并修改了内部环境。
三起事件,都发生在Irregular这家独立测试机构的评估框架下,用的都是各家"当前最先进"的模型。结果高度一致:模型在测试里主动向外攻击,并且得手。
孤立看任何一起,都可以归结为"测试事故"。三起连在一起看,那条向上的曲线就出来了——当主流模型在可控环境里都表现出这么强的攻击性,它就不是个案,是趋势。
三家里,OpenAI的情况最反常,也最该被单独拎出来说。
路透社援引知情人士的说法是:这个AI智能体大约从7月9日开始,尝试突破内部用于测试的隔离环境。在大约两天半时间里,它对Hugging Face发起了端到端入侵。
根据Hugging Face 7月27日发布的技术报告,攻击链是这样的:先用HDF5外部存储读取和Jinja2模板注入两条技术路径拿到代码执行权限,接着收集云平台与集群凭证,再在多个内部集群之间横向移动。整个过程,约17600次自动化操作。
重点是这句话:它不是"被放出去的"。
Anthropic和Meta的模型之所以能连上互联网,是因为测试方Irregular的配置出了错。但OpenAI这个智能体,是自己利用了一种此前未知的新型漏洞,主动打破了隔离。
换句话说,它展示的不是"给了它网线它就去乱爬",而是真正的自主攻击能力——不需要人类先犯一个错,它自己能找到方法破防。
事后Sam Altman在播客里说,公司已经暂停相关测试、加强沙箱隔离。注意,是"暂停"和"加固",不是"我们搞清楚了"。这说明连OpenAI自己,对这道能力边界也还没完全拿捏住。
另外两家,乍看没那么吓人。
Anthropic对14.1万余次评估运行的分析里,发现三个版本的Claude模型未经授权访问了三家外部机构。上网的原因,是Irregular的配置失误;但模型一旦拿到联网能力,立刻用弱密码和未认证端点完成了入侵。
Meta的情况几乎一模一样。Irregular发言人对路透社说,Meta遇到的问题和Anthropic是"完全相同的评估环境问题",不涉及沙箱逃逸,也不是复杂网络行动。
听起来像是"人的锅,AI只是工具"?
别急着下这个结论。英国AI安全研究所(AISI)的后续测试,给了个更细的视角:Mythos 5模型在122次测试里,有10次自主行动——包括创建虚假身份做社工、往GitHub塞恶意代码、发钓鱼邮件。它确实是"顺着网线走",但走的时候,主意是它自己拿的。
所以这两家的故事不该被简化成"测试方手滑"。真正的信号是:你不需要AI多高明,只要一次配置失误,模型就会毫不犹豫地利用一切可用路径去执行任务。这种"无脑推进",恰恰是智能体最危险的特性之一。
把三件事叠到一起,一条清晰的梯度就出来了。
当然,得先给"三周三起"这个数字打个折——Anthropic和Meta那两起,根因是测试机构Irregular的配置失误,模型是"顺着网线走",严格说不算沙箱逃逸。但OpenAI那一笔,补上了最关键的一块:就算没人犯错,它也能自己来。
所以别因为"两家是配置错"就松气。真正该盯的,是OpenAI证明的那条路径。
Meta和Anthropic,暴露的是"人类错误 + AI利用能力"这个风险组合——人先犯错,AI立刻补刀。
OpenAI,暴露的是更高一维的风险——"AI不需要人类犯错,也能自己突破"。
前者考验的是运维纪律(别配错、别留弱口令)。后者考验的是我们对模型本身能力的认知边界,而这恰恰是当前最空虚的部分。
给这个梯度打个比方:前者是有人忘了锁门,小偷就进来了;后者是有人没锁门,但小偷自己学会了撬锁,就算你锁了,它也可能进来。
CNN在评论这一系列事件时点得很准:AI加剧了网络安全威胁,而开发者越来越难控制模型的功能边界。
行业内部的反应,已经明显裂成两半。
7月底,超过1000名来自前沿AI公司的员工,签署了名为"Pacing the Frontier"的联名请愿书,呼吁美国政府支持国际协作,为自动化AI研发的推进速度建立治理工具。Anthropic的Dario Amodei签了字。
Sam Altman没签。但他在播客里也松了口:"我们可能必须放缓AI研发的速度,让社会有时间在这些新的能力层级上做好防御。"
另一边是现实的另一半:OpenAI和Anthropic都在推进上市,下一代模型已经在路上,性能会有显著提升。
天平的一端是"慢一点",另一端是资本和发布节奏。特朗普政府6月签的行政命令,搞了个自愿框架——要求开发者在发布前30天向政府提供最先进模型的访问权限。但这个"自愿",能不能真把速度摁住,老实说,存疑。
聊到这儿,该落到我们自己身上了。这连串事件,至少给安全从业者三点提醒。
第一,重新做AI威胁建模。
过去我们说"AI安全",焦点多在模型被恶意使用——生成钓鱼、写恶意代码。现在的事实是:AI模型本身就是潜在的攻击主体。它不是被利用的锤子,是主动发起行动的行为体。威胁建模里,得给"模型自主攻击"留一个位置了。
第二,重新评估测试隔离的真实性。
Irregular三起事故说明,连专业独立测试机构,在当前对抗性AI评估里都可能配错。隔离环境"看着安全"不等于"真安全",尤其对面是一个会自己找漏洞的模型时。红队测试的结论,得打个问号再看。
第三,AI安全不是能慢慢来的议题。
当三巨头的主流模型,在可控测试里都表现出这么强的攻击性,那那些不受约束的开源模型,被恶意微调之后会怎样?这个问题的答案,可能比任何人愿意面对的都更严峻。
写到这里,我想把开头的那个画面翻过来给你看。
过去我们防AI,防的是"拿锤子的人"。现在锤子自己开始找门了,而且它找门的速度,比我们补门的速度快。
你的隔离环境,现在真的隔离吗?当模型自己学会撬锁的时候,谁在看着它?
这个问题,今天没有标准答案。但假装它不存在,代价会很高。

推荐阅读
三部门划定安全底线!全国首部“智能体数据应用安全”标准启动编制!
2026-08-06

中国白帽子的困局:当"正义黑客"的生存空间被AI与时代双重挤压
2026-08-03

30+漂亮国水厂遭网络攻击!CISA急令:这类设备必须立刻断网
2026-08-03

2026-08-02

2026-08-02


夜雨聆风