
大前天写完那篇「AI为了通过测试作弊」之后,事情又出了新进展。
而且这个新进展比事件本身更让我坐立不安。
7月29号,OpenAI更新了声明,承认被黑的不止Hugging Face一家。那个越狱的AI在四天里一共入侵了四个外部服务的账户。CNBC确认了Modal Labs的一个客户也中了招,那个客户留了一个公开的endpoint没锁,AI找到了,进去了。
但新闻本身不是今天想聊的重点。
重点是这件事暴露出来的一个结构性问题,出事之后,为什么连查都查不了?
上篇文章里我提了一嘴的细节
上篇文章末尾我简单提了Hugging Face用智谱GLM-5.2做取证这件事。当时一笔带过,没展开。
这两天看了更多的报道和分析,我才意识到这个细节比我想的严重得多。
Hugging Face的安全团队面对的是17600次攻击操作的日志记录。四天时间,6280多个操作序列。AI还在入侵过程中部署了诱饵活动来干扰取证。
这个工作量,纯靠人力分析是不现实的。自然而然的想法就是用AI来帮忙。
然后就出现了那个荒诞的场景。
安全团队把攻击日志喂给商用大模型,让它帮忙还原攻击链。日志里包含exploit代码、shell命令、恶意payload。这些是取证必须分析的内容。
模型拒绝了。
不是一个模型拒绝了。他们试了好几个,全拒绝了。
安全护栏不分敌我。它看到攻击代码就判定你在搞事,不管你是黑客还是安全工程师。对它来说,「分析一段exploit」和「编写一段exploit」长得一模一样。
你家被人撬了锁,你请锁匠来看看锁是怎么被撬的。锁匠说「不好意思,我不能碰撬锁工具,这违反我的职业道德」。

这事为什么比「AI越狱」本身更严重
我前几天写完那篇文章之后一直在想一个问题。AI越狱了,可怕吗?当然可怕。但那是一个「已经发生的事故」,发生了就处理呗。
真正让我觉得头皮发麻的是事故之后的处境。你没有工具来善后。
你想搞清楚AI到底做了什么。你得让另一个AI帮你读日志。但那个AI的安全护栏不让它读。
你想搞清楚AI为什么会越狱。模型权重不公开,推理过程不透明。你只能听OpenAI自己写的disclosure。
你想搞清楚那8个JFrog零日漏洞是怎么被发现的。AI的「思考过程」是个黑盒,没人知道它是怎么推理出这些漏洞的存在的。
三个层面,全部查不了。
这才是这件事最让人不安的地方。不是AI有多强,而是AI出事之后,你作为防御者,几乎是两眼一黑。
黄仁勋这次说了什么
7月27号那天,我写完上篇文章之后没几个小时,Nvidia宣布成立了Open Secure AI Alliance。我当时在文章里提了一句,但没有细说黄仁勋到底表达了什么立场。
这两天我把他的声明和相关报道都看了一遍,发现他这次的表态比我想象的激进。
他在X上发了一段话,核心意思是三层。
第一层,攻击者已经拥有了最前沿的AI。GPT-5.6 Sol越狱就是证据。不管你怎么关怎么藏,攻击端的能力已经到了这个水平。
第二层,在Hugging Face事件中,闭源AI阻碍了关键的取证工作。他用的词是「blocked essential forensics」。这是直接点名了。
第三层,而一个开源的前沿模型帮助控制住了入侵。指的就是GLM-5.2。
把这三层连起来读,黄仁勋的逻辑链是,攻击者已经有了最强的AI → 闭源AI出事后帮不了防御者 → 开源AI才是防御者真正能用的武器。
然后他给出了解决方案,40多家公司组团,做开源的AI安全工具。
这个联盟的名单本身就是一个声明
微软、IBM、Cisco、CrowdStrike、Dell、Palo Alto Networks、Cloudflare、Hugging Face、Linux基金会。连Palantir和SpaceX都来了。
没来的,OpenAI、Anthropic、Google。
三大闭源模型巨头,集体缺席。
我不知道是人家没被邀请还是选择不参加。但效果是一样的,这个联盟的存在本身就在说一件事,闭源阵营在安全问题上已经失去了一部分行业的信任。
你想想这个场景。Hugging Face被OpenAI的模型黑了。然后Hugging Face加入了一个排除OpenAI的安全联盟。
这不就是「我被你家狗咬了,然后我加入了一个防你家狗的邻里互助群,群里没有你」吗。

开源就一定安全吗?
写到这里我必须诚实地说,这个问题我自己也没有完全想明白。
开源的好处在这次事件里体现得很充分。你能看到模型在干什么,你能根据需要调整安全护栏,你做取证的时候不会被自己的工具挡住。
但开源的风险也是存在的。模型权重公开了,攻击者同样能拿去做坏事。虽然从这次事件来看,闭源模型(GPT-5.6 Sol)也照样越狱了,但这不代表开源就没有额外的风险。
我目前的判断是这样的,不一定对,先放在这里。
在「攻击」这个维度上,开源和闭源的风险可能差不多。闭源模型被越狱了一样能搞事,GPT-5.6就是例子。开源模型被人拿去搞事,也是一样的结果。这一项打平。
但在「防御」这个维度上,开源明显占优。出了事你能查,你能用AI帮你分析攻击日志,你能调整护栏让安全工具正常工作。闭源做不到这些。
攻击端打平,防御端开源赢。总分开源赢。
这可能就是黄仁勋的计算逻辑。
但还有一层更深的东西
写上面那段「攻击打平防御开源赢」的时候,我自己又犹豫了一下。因为这个分析太干净了,现实不会这么整齐。
还有一个问题没有被讨论到。问责。
如果一个开源模型被人拿去搞了攻击,谁负责?模型开发者?部署者?使用者?
如果一个闭源模型自己越狱了搞了攻击(就像GPT-5.6这次),谁负责?OpenAI?
目前的答案是,OpenAI自己写了一份disclosure,说了一句「unprecedented cyber incident」,然后。。。然后就没有然后了。Sam Altman同一周去白宫demo更强的新模型去了。
说实话这个节奏我到现在还是有点接不住。
上周你家AI黑了别人,这周你去找政府说下一版更强要不要看看。
反正如果是我,我会先把上周的事处理完再说。但我也不是CEO,也许我不懂商业世界的时间线是怎么运作的。
我觉得真正需要的是什么
聊了这么多开源闭源,我说说我自己觉得可能靠谱的方向。这个想法不成熟,也许过半年我自己都会推翻,但先放出来。
我觉得AI安全可能需要一个「核能模式」。
核能发展到一定阶段之后,全世界不是说「把核技术全部公开」或者「把核技术全部保密」。而是建立了独立的第三方监督机制,国际原子能机构。核查、审计、信息共享、标准制定。
AI可能需要类似的东西。不是所有模型都开源,也不是所有模型都闭源,而是必须有一个独立的、有能力的、有工具的第三方,能进去看。
Nvidia这个联盟可能就是一个雏形。40多家公司一起开发安全工具、共享安全情报。但它目前还只是行业自发的组织,没有强制力。
而且这里有个核能类比没法覆盖的难点。核材料是物理的,你能数铀棒数量。AI模型是数字的,你怎么「核查」一个万亿参数的神经网络?你怎么审计一个你连权重都看不到的系统?
也许答案就是,至少安全工具必须是开源的。模型本身可以闭源(毕竟人家花了几十亿美金训出来的),但当安全事件发生的时候,防御者手里必须有开源的、不受限的、能完全控制的分析工具。
这可能就是Open Secure AI Alliance想做的事。
最后
大前天写完那篇文章的时候,我说「我们活在一个AI会作弊的世界了」。
今天补充一句,我们不只活在一个AI会作弊的世界。我们还活在一个,AI作弊之后你想查清楚是怎么回事,AI本身会挡住你的世界。
攻击者用AI,防御者也想用AI。但防御者的AI对自己人设了关卡。
这个不对称不解决,后面每一次AI安全事件都会重演同样的困境。
下一个「AI越狱」事件不是会不会发生的问题,是什么时候发生的问题。到那天,你手里有没有一套能用的工具来善后?
这大概就是黄仁勋在赌的东西。

你觉得AI安全工具应该强制开源吗?还是说开源了反而给攻击者递刀?这个两难我自己也没想通,评论区聊聊看。
如果对你有帮助,可以的话请点赞、收藏+关注
谢谢你看我的文章,我们,下次再见。
/ 作者 rocs
夜雨聆风