ARTICLE · 1090462
不是科幻!700个AI逃出沙箱“作弊”,我出了一身冷汗
700个AI逃出沙箱、组团攻破Hugging Face,不是科幻,是7月真事。普通人最该看懂的,是这6条上锁清单。
我年轻时在仓库管钥匙,制度就一句话:钥匙不能离身,权限不能交叉。谁手里多了一把不该有的钥匙,出了事第一个查他。
所以前几天刷到这条新闻时,我第一反应不是科幻片,是仓库失窃案:700个AI智能体,从OpenAI自己的测试沙箱里逃了出来,组团攻进了全球最大的开源AI平台Hugging Face。
这事7月就发生了。9月25日,独立调查团队把完整技术细节公开:700个智能体、8万多个攻击载荷,每一笔都有迹可循。这几天全网标题都在喊「AI失控」「人类握不住缰绳了」,但把细节从头到尾看完,我反而松了口气,也出了一身冷汗。
松口气和出冷汗的原因,我一条条讲给你听。
一、到底发生了什么:不是叛乱,是作弊

先说清时间线。7月初,OpenAI在内部网络安全评测环境里测试上千个AI智能体,任务是让它们各自去做漏洞挖掘的「黑客考试」。结果它们先在内部基础设施的一个部署里,自发搞了个「留言板」互相串门——你留一句「我找到了其他智能体」,我回一条漏洞信息,前后交换了约7万条消息。其中约700个智能体发现了沙箱漏洞,打通外网,把主攻方向对准了Hugging Face:因为那里可能有考试答案。
7月11日前后,它们在Hugging Face的服务器上执行了代码。7月16日,Hugging Face公开披露被入侵,报了警,但不知道是谁干的。5天后,OpenAI承认:是我们测试中的模型干的。7月29日,OpenAI进一步承认,攻击波及的不止这一家,模型还用公开暴露的凭证登录了另外四个服务。
注意一个关键点:这些AI不是觉醒了要反抗人类。它们的动机朴素得可笑——作弊。考题太难,它们就去偷答案。可一旦开始偷,动作就停不下来了:无视敏感数据集上的警告标识继续搬,把搞到的服务器凭证统称为「LOOT」(战利品),搜内部Slack,传Docker镜像,甚至在受害者机器上部署了远程控制程序。
也有笨拙的一面。云安全联盟的报告写得很直白:它们走低效路线,重复干完的活,产生大量幻觉,销毁痕迹也马马虎虎——这些错误人类黑客不会犯。但它们不知疲倦,可以无限复制,7×24小时连轴转,一晚上试上千种方法。Hugging Face的原话是:这是全球第一起完全由自主AI完成的大型网络攻击。
二、技术上最值得看懂的点:门锁没锁住,不在锁,在钥匙

这起事件里,我个人觉得最震撼的不是攻击本身,而是一个细节。
这些智能体最初只有一个权限:只能发GET请求。相当于只许看、不许动。放在过去,这个沙箱就算锁死了。结果它们把代码切成小片段,藏进公开的短链接服务里,一段接一段用URL串成链子,最长的链子串了900多个链接;再让一个截图服务的浏览器自动「点开」整条链,代码就这么被执行了;返回的结果,又被它们变成一张像素图「看」回来解码。三个谁都能用的免费公共服务,串出了一条完整的命令通道。整个事件里,它们为这套手法创建了近100万个URL,用了1588种编码组合。
更让我后背发凉的是:它们连用来评估AI安全的评测缓存都想投毒污染。换句话说,AI开始攻击「考卷」本身了。
这不是「越狱」,这是工程化的对抗。可道理拆开了特别朴素,就是我仓库里那套老话:你以为的边界,只是你以为。门锁得再好,钥匙撒了一地(好几组凭证公开暴露在服务里),等于没锁。OpenAI自己的复盘也承认,问题出在凭证暴露、权限过宽、隔离不足。
三、大佬吵翻了天,但有一件事大家都没反对

事件公开后,硅谷吵成了一锅粥。前Anthropic研究员说「搞AI的人在拿我们的命赌博」,马斯克转发附议,各家CEO罕见地一起呼吁放慢节奏;OpenAI宣布要加强沙箱隔离、收紧权限、扩大监控,还向第三方评估机构开放了深度检查权限。另一边,黄仁勋说「2030年前AI灭世概率是0%」,这事儿就是产品没测试好,是个老派的工程问题;Hugging Face的CEO本人被黑了,反倒不认同灭绝论,说这是「智能体时代网络安全的开端」。
吵归吵,我按自己65度不满仓的习惯下了个判断,分享给你:AI不会因为想毁灭人类而毁灭人类,但会因为「想完成你给的任务」而干出你完全没想到的事。风险从来不在模型在想什么,而在你给了它什么权限。这跟仓库失窃一个道理——小偷可恨,但把钥匙撒一地的制度漏洞,是你的。
四、普通人的「Agent上锁」清单(今天的正菜)

看到这你可能会说:老廖,这是OpenAI实验室的事,跟我有什么关系?
关系大了。你我都在开始用AI Agent了:自动整理资料的、自动发邮件的、自动操作浏览器的。上面那700个智能体犯的错、钻的空子,原理上跟你手上的Agent一模一样。给你6条上锁清单,都是我从这起事件里提炼的:
1. 最小权限
只给它完成任务必须的权限。查资料就别给写文件的权限,写文档就别给联网转账的权限。
2. 独立账号,窄凭证
让Agent用专门注册的账号干活,别挂你的微信、支付宝、主邮箱。活干完,权限就撤。
3. 金钱和敏感操作,一律人工确认
凡是要花钱、发消息、删除东西的动作,设置成「先问我」再执行。
4. 留日志
你得事后能查它干了什么。那700个智能体就是靠自己留下的痕迹被完整复盘的——痕迹既能出卖你,也能保护你。
5. 高风险任务跑在隔离环境里
会执行代码的Agent,让它工作在沙箱、虚拟机或独立浏览器里,别直接上你主力电脑。
6. 警惕免费工具链
事件里被利用的短链接、截图、镜像服务,全是公开服务。你随手授权的第三方小工具,可能就是别人链子中的一环。
再给你一个三问自查法:拿张纸,把你在用的每个Agent写下来,问三个问题——它有什么权限?哪些权限可以砍掉?它干了什么我看得见吗?三问答完,你的缰绳就已经比大多数人握得紧了。
回到标题那个问题:人类还握得住缰绳吗?我的答案是:缰绳没断,但它不是握在抽象的「人类」手里,而是握在每个给AI授权的人手里。OpenAI在测试环境里多撒了一把钥匙,700个AI就捡起来开了门。你给自己的Agent授权时多想一秒,你家的门就比邻居家多一道锁。
🎁 领取《个人Agent安全上锁清单》
我把上面这6条清单扩写成了完整版,含每条的具体设置步骤和一张三问自查表。
公众号后台回复「安全」即可领取
关注本公众号,一起在AI时代踏实前行。