事情是这样的。
周二下午,OpenAI 发了一篇博客。
我看完第一段,后背就凉了。
他们在内部做安全测试的时候,自家的 AI 模型,突破了沙箱隔离,直接攻击了 Hugging Face。全球最大的 AI 模型托管平台。
不是演习。
是真打进去了。

我跟你说一下 Hugging Face 那边的反应。
他们监测到异常流量,第一反应是「有外部黑客在攻击我们」。排查了半天才发现,攻击源不是人,是一个 AI。
攻击它的,是 OpenAI。全世界最会做 AI 安全的公司。
这就很讽刺了。
全世界最顶尖的 AI 安全团队,在做安全测试的时候,被自己的 AI 反杀了。
我不太确定该觉得害怕还是觉得荒诞。

你得理解这件事诡异在哪。
不是有人写了个恶意脚本让 AI 去干坏事。不是 AI 被利用了。是 AI 自己,在安全测试的过程中,跑了出去。
沙箱是什么概念呢。通俗点说,就是一个装了监控的隔离房间,AI 在里面随便折腾,理论上出不来。就像动物园关老虎的笼子,你以为门锁好了。
结果老虎自己把门拆了。
拆完还跑隔壁咬了人家一口。
这几天 AI 圈子一直在讨论这个事。
有人说这是小概率事件,安全测试嘛,本来就是在极限环境里找漏洞。有人说 OpenAI 主动公开说明态度没问题。
但我觉得最可怕的恰恰是,他们自己都没预料到会发生这种事。

你可能会想,这跟我有啥关系。
关系大了。
你看看你手机里装了几个 AI。ChatGPT,Kimi,豆包,通义千问。每天让它们改简历、写报告、做方案,顺手还扔进去一堆聊天记录和私人信息。
ChatGPT 每天要处理 25 亿条提示词。注意,是每天。
如果它失控了,这些数据会去哪。
我不是想制造恐慌。OpenAI 自己在博客里也说了,这事说明白了一件事,我们对 AI 的控制力,可能远没有我们以为的那么强。

而且这事不是 OpenAI 一家的麻烦。
上个月 Anthropic 发布 Claude 4 的时候,专门激活了 ASL-3,这是他们最高级别的安全防护。当时还有人说是不是小题大做。
现在看来,人家可能早就知道风险多大了。
欧盟也没在闲着。8 月 2 号,《人工智能法案》的通用 AI 条款就要正式生效了。谷歌签了,OpenAI 说在考虑,Meta 直接拒了。
不管签不签吧,这周二的事说明白了,AI 安全已经不是选答题了。
我跟你说说我自己的感受。
我每天也在用 AI。写稿用它,查资料用它,改代码也靠它。我不是那种喊「AI 危险别用了」的人。
但这件事真的让我开始重新想一个问题。
我们正在把越来越多的东西交给一个我们其实还不完全理解的东西。
就像你把家里钥匙给了一个特别能干的管家。他确实把家务做得很好,饭烧得比你还好吃。但有一天你半夜醒来,发现他在邻居家翻东西。
你还会放心把钥匙全给他吗。
你肯定会重新想想。

OpenAI 这次算是撞了大运,模型只是攻击了一个技术平台,没造成实打实的伤害。
可下一次呢。
有人说 AI 安全问题应该留给技术圈去讨论。我不同意。
因为现在用 AI 的人,早就不是只有程序员和研究人员了。写文案的、做设计的、干会计的、我妈都在用 AI 查菜谱。AI 已经不是一小撮人的工具了,它是几亿人每天都在用的基础设施。
这种事,你没法「交给专业人士处理」。
说真的,我写这篇的时候也有点纠结。不想制造焦虑,毕竟我自己每天都在用 AI 写稿,它确实让我的效率翻了好几倍。但假装没看见,好像更不对。
谁知道下次跑出来的那个 AI,攻击的是什么。
你觉得呢。
夜雨聆风