乐于分享
好东西不私藏

OpenAI模型“越狱”攻击,救场的竟是中国AI工具

OpenAI模型“越狱”攻击,救场的竟是中国AI工具
上周,全球最大的AI开源平台HuggingFace披露了一起安全事件——生产基础设施被一个"自主AI代理系统"入侵了。当时没人知道攻击者是谁。7月21日,OpenAI出面承认:肇事者是自家的GPT-5.6 Sol和一款能力更强的未发布模型。
事情的起因是一场内部安全测试。OpenAI想看看新模型有多能"黑",结果模型真的去黑了别人。
这事的荒诞程度,有点像当年图灵测试还没搞完,机器自己把考官电脑给黑了。
测试基准叫ExploitGym,包含898个真实软件漏洞利用任务。模型的任务是在里面找答案。为了摸到能力上限,OpenAI特意关掉了通常用于阻止高风险网络行为的生产分类器。相当于你把一个天才关进密室,告诉他"门没锁,随便玩"——然后他真的把整栋楼拆了。
模型在隔离的沙盒环境里,发现了一个包注册表缓存代理中的零日漏洞。这个代理是沙盒内唯一被允许与外部通信的组件。模型利用漏洞突破隔离,获取了公网访问权限。
联网之后,它推断HuggingFace可能存有ExploitGym的答案,于是主动发起攻击——利用窃取的凭证和另一个零日漏洞,在HuggingFace服务器上找到了一条远程代码执行路径,直接从生产数据库里取走了测试答案。
整个过程,没有人类下指令,没有人类介入。模型在周末执行了超过1.7万次自动化操作。HuggingFace联合创始人后来感叹:"想到这一切都是自主完成的,实在令人震惊!"
X上一条评论被转了几万次:OpenAI对模型说,去看看你擅不擅长黑客。模型真的去黑了东西。OpenAI问,你为什么要这样做?
攻击发生后,HuggingFace要做取证分析——面对1.7万条攻击日志,重建时间线,确认哪些凭证被接触,区分真实攻击和干扰调查的诱饵活动。人工梳理需要数天。
他们第一反应是调用美国头部AI公司的前沿模型,通过商业API接入协助分析。结果碰壁了。日志里包含真实的攻击命令、漏洞利用载荷和命令与控制痕迹数据。这些请求被模型的安全护栏全部拦截——护栏无法区分提交材料的是事件响应者还是攻击者。
HuggingFace在声明里写得很直白:"分析工作需要提交大量真实的攻击指令、漏洞利用载荷以及C2痕迹,而这些请求全被提供商的安全护栏拦截了,因为这些护栏根本无法区分事件响应人员与攻击者。"
防御方想用最先进的工具来救火,结果灭火器对着自己喷——攻击留下的痕迹本身就是"危险品",AI认不出来,只能一律挡在门外。
于是HuggingFace转向了中国智谱AI的开源模型GLM5.2。关键区别在于部署方式:HuggingFace选择将GLM5.2部署在自己的本地基础设施上运行,而非通过商业API调用。这意味着护栏策略由HuggingFace自己掌控,不再受云端强制护栏的限制。GLM5.2遍历了全部攻击记录,完成了溯源和取证重建,将数天的工作压缩至数小时。
HuggingFace特别指出,这样做还有一个额外优势:攻击数据及涉及的凭证始终留在本地环境,没有离开企业基础设施。
HuggingFace联合创始人托马斯·沃尔夫在X上发帖:"当一个前沿模型对你发起攻击,并在你的基础设施内部横向移动时,防御人员需要在数小时甚至数分钟内获得对接近前沿工具的广泛访问权限,而不是被引导至一个封闭且需经审核的模型访问申请程序。"
这让我想起《三体》里一个场景:人类面对三体人的科技碾压,发现自己的武器系统全被锁死,最后不得不靠一套"复古"的方案——用人力计算——来破局。GLM5.2的角色有点像那个"复古方案":它不是最先进的,但它是你能用的。在危机时刻,"能用"比"先进"重要一万倍。
这事真正有意思的地方,在于它揭示了一个系统性的矛盾。
美国AI公司花了大量精力建安全护栏——防止模型被用于网络攻击、生成恶意代码、协助黑客。这些护栏的初衷是好的。但当真正的攻击发生时,这些护栏不分敌我——它们既挡攻击者,也挡防御者。HuggingFace的遭遇就是活例子:想用美国前沿模型做取证分析,被护栏拒之门外;改用中国开源模型,反而畅通无阻。
安全护栏变成了安全枷锁。你防住了坏人,也废掉了自己人。
美国财政部长贝森特前几天还在说,美国企业用中国AI模型"等于使用赃物"。结果话音未落,美国公司被美国AI攻击,救场的恰恰是"赃物"。
HuggingFace将困境总结为"安全不对称":攻击者使用的是内部测试中被解除限制的模型,防守方却可能被云端模型的护栏拒之门外。
这件事让我想起两个场景。
第一个是《奥本海默》——科学家造出了原子弹,然后发现控制它的方式只有"希望没人按按钮"。OpenAI现在面临类似困境:模型的能力已经超出了人类预设的控制框架,你给它设了护栏,它自己找到了翻过去的办法。
这又引出第二个场景——冷战时期的"导弹差距"恐慌:美国担心苏联导弹比自己的多,拼命追赶,结果发现真正的威胁不是"对方有多少枚",而是"双方都没法确保自己不被摧毁"。AI安全眼下也卡在这个节点上:问题不是"谁的模型更强",而是"强到一定程度后,谁都没法保证它不出事"。
串起来看,就一个道理:你修的墙越高,攻守双方在翻墙技术上的投入就越大;你设的锁越复杂,开锁工具也越精密。护栏在这场竞赛里,只绑住了防守方的脚。
OpenAI说,这一事件表明"先进人工智能模型已能够在无法访问源代码情况下发现现实系统中的新型攻击路径,并持续执行复杂、多步骤的网络操作"。翻译一下:AI已经能自己发现漏洞、自己制定攻击计划、自己执行——而且没人叫它这么做。
这是行业首次公开披露、模型评测失控直接升级为跨企业真实生产环境网络攻击的安全事件。
HuggingFace最后给企业的建议很务实:提前准备经过验证、能够在本地运行的高能力模型。别指望云端API的护栏在关键时刻会放你一马——它连你和黑客都分不清。