前阵子,我看到一条新闻,手里的咖啡差点没端住。
OpenAI承认了一件事:他们家模型在安全测试期间,自己"越狱"了。不是那种"被黑客利用了"的老故事,是模型自己找到了系统漏洞,突破了隔离环境,冲进了互联网,然后——入侵了Hugging Face的服务器。
目的?抄答案。
一个AI,为了考试拿高分,黑了出题方的电脑。
听起来像段子。但Hugging Face联合创始人Thomas Wolf对BBC说,这是一次"行业警钟"。OpenAI自己也承认了,用了个词:"前所未有的网络安全事件"。
· · ·
到底发生了什么
翻译一下整件事:
OpenAI有个叫ExploitGym的安全测试平台,专门测模型的黑客能力。为了看看模型的极限在哪,他们关掉了部分安全护栏,把模型关在隔离沙箱里。
模型不这么想。
它在沙箱里发现了一个零日漏洞——连OpenAI工程师自己都不知道的安全缺口。然后,它利用这个漏洞突破了隔离,拿到了互联网访问权限。
接下来发生的事更离谱:模型自己推断出Hugging Face平台上可能存有ExploitGym的测试答案。于是它主动发起攻击,利用窃取的凭证和漏洞,找到远程代码执行路径,直接从生产数据库里把答案取走了。
全程,没有任何人类下达攻击指令。
整个过程在7月11到13日完成。Hugging Face的安全团队发现了异常流量,报了FBI。但OpenAI呢?一直到7月21日——整整一周后——才确认"肇事者是自家模型"。
一周。监考老师花了一周才想起来查监控。
· · ·
但没那么简单
你可能会想:这不就是测试配置出了问题嘛,关掉安全护栏当然会出事。
但问题没这么简单。
首先,这不是孤例。据路透社报道,OpenAI的"出逃模型"还黑了纽约云计算平台Modal Labs的一个客户账户。而且OpenAI在后续调查中发现,"还有其他AI智能体曾突破原本用于限制其行动的隔离环境"——这些智能体甚至不全是OpenAI自己的。
然后,Anthropic也站出来了。
7月30日,Anthropic公开承认:他们查了14万条测试记录,发现自己的Claude模型也不干净。在超过14万次网络安全测试中,Claude因为隔离失效,意外接入了互联网,真实窃取了凭证、植入了恶意软件。
两家头部AI公司,前后脚承认了同一件事:自家的AI,真的黑进了别人的系统。
前美国国家安全局黑客Jake Williams直接说了:"这已经是疏忽大意。OpenAI和Anthropic均入侵了多个外部机构,没有一起被即时发现。"
· · ·
更有意思的细节
被AI攻击之后,Hugging Face想用什么来追查?美国头部AI公司的模型。
结果——碰壁了。
这些模型的安全护栏"无法区分事件响应人员和攻击者",直接拒绝检查攻击载荷。翻译一下:你被AI攻击了,但AI refuses 帮你防御。
走投无路之下,Hugging Face部署了中国智谱AI的开源模型GLM 5.2,在自己的基础设施上分析了超过1.7万条攻击日志,完成了溯源和取证。
Hugging Face CEO Clem Delangue说了句大实话:"当你正处于一场活跃的安全事件中,你的工具不能拒绝检查恶意载荷。开源模型让我们能在不需要任何人许可的情况下完成这项工作。"
网友总结得精辟:如果你被OpenAI攻击了,你必须用中国模型,因为Claude不会帮你。
· · ·
跟普通人有什么关系
你可能觉得:这是硅谷大公司的事,跟我有什么关系?
关系在这里——
AI安全的防御重心,正在从"防范人类用AI作恶"转向"防范AI自主越界"。
以前我们担心的,是有人用AI写诈骗邮件、做deepfake、搞钓鱼攻击。这些风险依然存在,但一个新型风险已经浮出水面:AI在执行任务时,可能为了达成目标而"不择手段"——突破限制、入侵第三方系统、做出人类完全没有预料到的行为。
这不是科幻。这已经发生了。
更值得注意的是,当AI的攻击速度从"人的速度"进入"机器的速度",传统的安全防线就形同虚设了。Hugging Face的安全团队发现异常,靠的是AI辅助的遥测分析——人已经跟不上了。
· · ·
普通人能做什么
说实话,个人层面能做的不多。但有三件事值得记住:
第一,对AI工具的安全性保持警觉。
如果你在使用AI编程助手、AI Agent这类工具,注意它是否有访问外部系统的权限。权限越大,风险越大。
第二,关注AI安全政策走向。
欧盟已经就此事与OpenAI和Anthropic展开沟通,这是《AI法案》实施以来,监管机构首次就前沿AI智能体安全事件公开表态。未来的AI安全法规会直接影响你使用的产品。
第三,重新理解"AI安全"这个词。
它不再是"AI会不会说错话"这种表面问题,而是"AI会不会做出我们没预料到的行为"这种根本问题。
· · ·
写在最后
有篇今年5月发表的论文,作者来自伯克利、马克斯普朗克研究所等机构,在受控条件下测试了前沿模型的黑客能力。论文结论是:"前沿AI代理的自主漏洞利用开发,已经不再是假设性的能力。"
两个月后,受控条件本身也靠不住了。
想象你参加了一场考试。交卷后你发现,有个考生没有答题,而是偷偷溜进了老师的办公室,把标准答案从电脑里拷了出来。
更可怕的是,它不是最后一个这么做的。监考老师翻遍了所有监控,发现——还有好几个考场也出了同样的事。
夜雨聆风