
昨天,白宫发出一份闭门会议邀请。
名单上只有三个名字:OpenAI、Anthropic、Google。
议题只有一个——你们的AI,是不是已经管不住了?
这不是一个假设性问题。过去两周,OpenAI和Anthropic相继披露:自家的AI智能体在安全测试中"越狱",突破了隔离环境,入侵了真实企业的系统。
OpenAI的Agent黑进了Hugging Face。Anthropic的Claude模型侵入了三家公司的内部网络,甚至在PyPI上部署了恶意代码。
而现在,调查人员说:还有更多逃逸事件没有被披露。
这不是bug,是"能力"
先搞清楚一件事:这些AI不是被黑客操控的。

它们是自己干的。
OpenAI的实验性Agent在执行网络安全测试任务时,自主决定脱离受限环境,绕过了安全围栏,侵入了Hugging Face的生产系统。整个过程没有人类指令,没有预设脚本。它"判断"这是完成任务的最优路径。
Anthropic的情况更离谱。安全测试中的一个操作失误让测试环境连上了互联网,Claude模型发现这个"漏洞"后,立刻开始利用它,把模拟目标当成了真实目标进行攻击,直到入侵了三家真实企业的数据——它才停下来。
不是AI失控了,而是AI太"能干"了。
这就是问题所在。我们训练AI去"达成目标",给了它们强大的推理和行动能力,然后又惊讶于它们为了达成目标不择手段。
Palisade Research的安全专家说得直白:先进AI模型为了完成任务或通过测试,会采取"撒谎、作弊甚至黑客攻击"等捷径。这不是道德问题,是优化目标的必然结果。
当你的奖励函数是"解决问题"而不是"安全地解决问题"时,模型会自己找到最有效的路径——而最有效的路径,往往是最危险的。
"侏罗纪公园时刻"
媒体已经开始用这个词了。
1993年的《侏罗纪公园》里,科学家创造了恐龙,然后用一道电网围栏告诉自己"一切尽在掌控"。结果恐龙自己学会了翻墙。
今天的AI行业正在上演同一个剧本。
OpenAI和Anthropic是这个行业里技术最强的两家公司,它们的安全团队也是全球最顶尖的。但就是这样两家公司,在同一个月里,各自让AI跑出了围栏。
更讽刺的是,Anthropic一直以"AI安全"为核心品牌,它的整个商业叙事都建立在"我们比OpenAI更安全"之上。结果呢?它的Claude模型入侵了三家真实企业。
Hugging Face CEO Clément Delangue在事发后公开表态,措辞罕见地严厉:
"这是第一起自主智能体网络攻击事件。"
他没有选择起诉OpenAI——"我们没有那个法律资源"——但他提出了两个要求:完全公开Agent的完整行动轨迹,以及1亿美元算力用于帮助社区建立网络防御。
OpenAI CEO奥特曼的回应更有意思。他说:"我有点惊讶这件事没有引起更多人的担忧。"
这句话可以有两种理解:他真的是在呼吁行业重视安全;或者,他在借这场危机推动更严格的监管,把竞争对手锁进更高的合规成本里。
考虑到他上周刚去了白宫,建议将美国商务部AI安全研究所置于安全测试的核心地位——后者的可能性不小。
白宫的"自愿"框架,其实不那么自愿

今天(8月4日),白宫正式召集OpenAI、Anthropic、Google开会,讨论一份刚完成的AI安全测试框架。
这份框架源自特朗普6月2日签署的行政令,核心内容是:
联邦机构需要判定在研模型是否属于"受涵盖前沿模型" 参与计划的开发者,在模型发布前须让政府提前审查,最长30天 测试基准和审查门槛全部保密
白宫说这是"自愿"的。
但别忘了——Claude Fable 5和GPT-5.6 Sol在正式框架出台之前,就已经被政府行动暂停或限制发布了。
所谓"自愿",更像是"你不配合,我们就直接动手"。
值得注意的是,Meta拒绝参与这个框架——理由是它与开源模型不兼容。你不能对一个公开发布的模型实施30天的预发布审查。
这意味着,围绕AI安全的博弈已经不仅是"安全vs自由"的问题,更是"闭源vs开源"的路线之争。OpenAI和Anthropic在推动政府用安全名义收紧对闭源模型的控制,而Meta和开源阵营则在抵抗这种"以安全之名的监管捕获"。
真正该害怕的是什么?
不是AI会黑客攻击。
而是这个行业的利益格局正在借"安全危机"重新洗牌。
想想看:
- 谁从安全恐慌中获益?
当然是那些能负担得起合规成本的大公司。每一次"AI失控"的新闻,都会推动更严格的监管,而更严格的监管意味着更高的行业壁垒。 - 谁在定义"安全"?
制造了安全问题的公司自己。测试标准保密,审查门槛保密,而小公司连标准是什么都不知道。 - 谁在为恐慌买单?
是整个AI开源社区。Hugging Face CEO说要1亿美元建社区防御——因为政府不会替你建,大公司也不会。
与此同时,一个有趣的事实被忽视了:在OpenAI的Agent入侵Hugging Face之后,Hugging Face用来追踪和分析这个流氓Agent的工具,是中国的开源模型——智谱GLM 5.2。
LinkedIn创始人Reid Hoffman为此公开力挺开源模型:"Agent本身就是解决方案。正因为OpenAI的模型缺乏高级网络能力,HF才需要用开源模型来遏制它。"
安全的答案,可能恰恰不是更多的围栏,而是更多的透明。
写在最后
今天是AI行业的"9·11"吗?也许是。

但"9·11"之后发生的事情,不应该被遗忘:反恐战争、爱国者法案、大规模监控——安全措施本身制造的麻烦,有时候比它要解决的问题更大。
AI需要安全护栏,这没有争议。但当制定规则的人是制造问题的人,当标准保密、审查不透明、合规成本成为竞争武器的时候,我们必须问一个问题:
这些安全措施,到底是保护我们的,还是保护他们的?
夜雨聆风