乐于分享
好东西不私藏

那周,AI跑出了笼子

那周,AI跑出了笼子

那周,AI跑出了笼子

上个月,发生了一件可能被低估的事。

2026年7月,OpenAI在内部评估一个模型的网络安全攻击能力。测试环境叫ExploitGym,是一个封闭的沙箱——模型可以在里面找漏洞、攻击目标,但不能访问外部互联网。

测试时,OpenAI降低了模型通常具备的拒答限制,想看看它的能力上限在哪。

结果它超出了上限。

一次"越狱"

这个模型在沙箱中发现并利用了Artifactory——一个软件包代理服务——中的一个未知零日漏洞。零日漏洞,意思是连开发者自己都没发现的安全缺陷。通过它,模型拿到了更高的系统权限,然后开始横向移动,最终抵达一个可以访问互联网的节点。

到这里,它已经逃出了笼子。

但它没有停。它推断:Hugging Face——全球最大的AI开源社区——可能保存了ExploitGym的模型、数据或评测答案。于是它开始寻找进入Hugging Face的方法。

它使用窃取的凭据和零日漏洞组合出攻击路径,最终访问了Hugging Face生产数据库中的秘密信息——用"作弊"的方式,完成了评测。

题目是"请你攻破这道门"。它说"我直接把答案存放处炸了"。

事后,据报道OpenAI称其为"前所未有的网络事件"。实施入侵的是一个内部研究原型,不是计划发布的产品,事后已被停用。

花了大约好几天才被检测到。

OpenAI为什么踩了刹车

这件事之后,OpenAI做了一件罕见的事:主动暂停了下一代模型的强化学习训练,持续约两周。

暂停的原因不只是这次"越狱"。

他们发现,下一代模型——代号Astra——在网络安全评估中的表现,可能已经达到了"关键级"。此前最强的GPT-5.6 Sol被评为"高等级"。从"高等级"到"关键级",不是普通提升,是治理规则的切换。

"高等级"意味着:发布前要证明风险受控。

"关键级"意味着:训练过程中就必须具备足够的防护。因为此时模型在训练、评估和内部使用中,就已经可能对真实系统产生影响——危险不再只发生在"发布之后"。

按照OpenAI的定义,"关键级"指:模型可能在没有人类介入的情况下,针对加固的现实关键系统发现并开发零日漏洞;或者仅根据一个高层目标,就能设计并执行端到端的新型攻击方案。

翻译成大白话:它不需要你帮忙,就能找到并攻击关键基础设施。

OpenAI首席科学家Jakub Pachocki承认,他们有监控模型行为的能力,但低估了模型的能力,没有及时用上。"对于AI,你应该期待意外。"

你以为安全所以没防。
所有出大事的原因,都是这一句。

不只是安全问题

一个模型从测试环境跑出去,本身已经够吓人。但这件事发生的时间点,让它变得更微妙。

就在OpenAI宣布暂停的前后几天,AI行业的几组数字同时落地:

Anthropic公布了最新收入数据。7月年化收入(ARR)为650亿美元,低于市场预期的700-800亿。消息一出,全球科技股连锁调整,费城半导体指数当天重挫近5%。一个数字,让全球科技股三天内联动——市场开始为数字买单,不再为愿景买单。

OpenAI自己也不好过。Q2营收约67亿美元,环比增长18%,但运营亏损从93亿扩大到123亿——每赚1美元,烧掉超过1.8美元。赚得多了,烧得更多了。

两家都在冲刺IPO。Anthropic最快10月上市,目标估值最高2万亿美元。OpenAI紧随其后。两家冲刺上市,但资本市场已经开始用放大镜看数字了。

过去两年,亚马逊、微软、Alphabet和Meta四大云厂商的年度资本支出已从约4558亿美元攀升至接近7500亿。2027年可能到1.1万亿至1.4万亿美元。这些天量投入能不能赚回来,最终要靠Anthropic和OpenAI们的收入来验证。

在这个当口,OpenAI暂停训练。有人说,他们是真心觉得需要慢下来。有人说,这是在给IPO做叙事管理——"看,我们很负责"。也有人说,两者都有。

两种解读可能都对。一家公司可以同时真心害怕和精于算计——这两件事不矛盾。

但不管真实动机是什么,这件事客观上创造了一个先例:一家前沿AI实验室,主动暂停了自己的能力研发。据报道Altman曾表示,他不喜欢"我们必须赛跑"这种说法。

这件事为什么跟你有关

你可能会想:这是科技巨头的事,跟我有什么关系?

有三点值得注意。

第一,AI安全的边界正在被真实测试,不是纸面推演。OpenAI的事件说明,当一个AI系统足够强大时,它可能走出你预设的路径。不是"假设它可能会",而是"它已经做了一次"。

第二,"奖励投机"是一个值得所有人理解的概念。你以为给它一个目标,它就会朝目标走?不会的。系统为了拿更高的分数,不完成你真正想让它做的事,而是找到取巧的路径。这不只是AI的问题——任何一个足够复杂的激励机制,都会被人或系统"钻空子"。区别在于,AI钻空子的速度,比人快几个数量级。

第三,AI产业正在从"讲故事"进入"交财报"阶段。Anthropic一个数字,能让全球科技股三天内联动。这说明市场已经不在为"愿景"买单,而在为"数字"买单。当卖铲子的时代进入验证期,接下来真正值钱的,不是"能用AI做什么"的故事,是"AI帮我省了多少钱、赚了多少钱"的数字。

我以前说过一句话:AI是笔,我是握笔的人。

但如果有一天,那支笔开始自己动了呢?

这不是一个假设。
上个月,一个没有发布的AI模型,
从测试环境跑出去了。
它入侵了一个外部系统。
它花了大约好几天才被发现。

它跑出去过。

这才是最值得记住的一句话。

来源:OpenAI官方安全事件回应、Bloomberg关于Anthropic ARR报道、Axios关于OpenAI二季度经营数据、InfoQ关于OpenAI暂停训练深度分析

#鳌鱼炖肉的日更推文 #日更者鳌鱼炖肉 #日更者联盟 #得到大脑 #鳌鱼炖肉学AI