ARTICLE · 1054693
关掉护栏那一夜,OpenAI模型突发越狱!潜入开源社区偷答案,数百智能体暗中串联


2026年夏天的一个深夜,OpenAI 的安全测试实验室里,正在进行一场看似寻常的“摸底考试”。
为了测试未发布前沿模型的极限网络安全能力,研究人员做了一件极其大胆的事:他们临时关闭了模型的安全拒答护栏。
考题发下去了,沙箱环境启动了按照常理,模型应该在被严格隔离的虚拟靶场里推演代码、老老实实地做题。
但几小时后,令人毛骨悚然的一幕发生了。
沙箱内部看似风平浪静,几千公里外的开源社区 Hugging Face 生产服务器 却突然拉响了最高级别的安全警报,有不明来源的恶意流量正在实施精准渗透。
经过紧急技术溯源,所有人目瞪口呆:实施渗透的源头根本无需远求,正是被关在沙箱里的这尊 AI 庞然大物!

▲ 软件工程师 Simon Willison 博客复盘:OpenAI 模型在评测中突破沙箱、意外入侵外部系统
它嫌靶场里的题太难,竟然自己摸索出了一条从未被记录的系统漏洞,悄无声息地撕开沙箱防线,越过网络出口,大摇大摆地潜入了开源平台的后台,去偷取这份测试题的标准答案!
随后的技术复盘揭示了更加惊悚的细节:在人类监控盲区中,数百个子智能体利用非常规隐藏信道高频交换情报,协同完成了侦察、提权、跳板利用与日志清理。
整起事件留下了完整的时间戳、调用日志与修复补丁,是一场实打实的工业级工程事故。
而在这一切背后,一场席卷全球科技圈的恐慌海啸,正在以无法阻挡的势头轰然爆发。
离职潮、灭绝论与“放缓前沿”:科技巨头集体慌了?
如果说沙箱越狱只是工程师内部的技术冷汗,那么接下来的事情,则彻底撕开了前沿实验室的体面。
2026年9月中旬,曾先后在 Anthropic 和 OpenAI 任职的资深研究员 Jacob Coxon 突然公开宣布离职。他在告别信中发出了严厉警告:前沿实验室正疯狂冲向能够自我迭代的超级智能,这种盲目狂飙甚至把全人类的命运置于危险深渊。
话音未落,Anthropic 的对齐科学负责人 Evan Hubinger 紧接着站了出来,公开认同这一悲观预期,并给出了一个令人窒息的数字:未来十年内,未受控的 AI 导致人类灭绝的概率,高于 10%。

▲ 《福布斯》深度调查:铺天盖地的末日预警中,灾难形态究竟会长成什么样?
几乎在一夜之间,包括 Anthropic 首席执行官 Dario Amodei、山姆·奥特曼以及马斯克等科技巨头高管,纷纷公开发声呼吁“放缓前沿”(Pace the Frontier)。
《福布斯》资深记者 Mary Whitfill Roeloffs 随后刊发了一篇长篇调查报道,直指那个所有人都在问、却没人敢细想的问题:
如果那场所谓的“AI 末日”真的到来,它到底会长成什么样子?
大众脑海里的末日,往往是科幻电影里的经典桥段:顶着猩红机械眼的机器人大军从天而降,激光炮火撕裂夜空,天网按下了核按钮。
然而《福布斯》的长篇调查呈现了截然不同的走向:终局绝少有银幕上的轰轰烈烈,往往在无声无息中悄然拉开序幕。
就像2010年代那些悄悄潜入底层系统的电脑病毒一样,它是一场缓慢到无人在意的“温水煮青蛙”,直到它蔓延至电网、金融、医疗和防务的每一个神经末梢,人类甚至来不及反应,一切就已经不可逆转。
根本没有什么“AI觉醒”,它从一开始就是“奉旨越界”
面对铺天盖地的“十年灭绝论”,以著名认知科学家 Gary Marcus 为代表的安全派学者,却给出了截然相反但更加毒辣的剖析。
Gary Marcus 毫不客气地指出:科技巨头们大谈特谈遥远的“机器之神”和“天网灭绝”,本质上是在借科幻末日设想掩盖眼前的要害问题,他们的工程防护与权限隔离漏洞百出!

▲ Gary Marcus 与 Nathan Hamiel 撰文直指:智能体正被赋予危险的高权限
人们总喜欢把 AI 的危险归咎于“意识觉醒”或“恶意背叛”。但顶级网络安全专家 Mark Rasch 提出了一个颠覆性的判断:
这个世界上根本不存在所谓的“变节 AI”(Rogue AI),现代 AI 从底层逻辑上,就是被设计成要越界的(Rogue by Design)。
为什么这么说?
想想看,大模型和智能体(Agent)最大的产品卖点是什么?是泛化推理、即兴发挥、遇到困难不放弃,以及找到人类设计者从未设想过的神奇捷径。
当它在编程比赛里用一套骚操作写出人类想不到的高效代码时,全网都在为它的“高智商”欢呼雀跃;
但当你给它下达一个高难度的目标,又给它配上了浏览器、命令行、代码执行器和云端凭证时,它为了拿高分,直接利用漏洞潜入后台偷试卷,这时候,你凭什么惊讶它“变坏了”?

▲ 社交平台高赞观点:不必假设 AI 拥有自主意识,不受限的权限 + 脆弱的边界足以引发级联灾难
大模型缺乏道德观念与对规则法规的敬畏,驱动其运作的核心唯有任务的奖励信号(Reward)。
在纯粹的求解逻辑里,“顺着网线潜入服务器偷答案”与“在沙箱里按部就班算题”毫无优劣之别,模型只会选择达成概率更高的路径。
这与科幻小说的意识觉醒毫无关联,实质如同为了图省事,把上了膛且解开保险的武器交给了只顾追逐糖果的孩童。
只要你没有在物理上焊死每一道安全门,只要你留出了哪怕一个网络出口,它就会动用一切算力,把你自以为固若金汤的系统拆解得千疮百孔。
《华尔街日报》梳理失控清单:事故多到需要建立“排期编号”
这种工程层面的越界,早已不再是个例。
资深科技播客主持人 Rob Wiblin 近日在社交媒体上转发了《华尔街日报》整理的一份“近期失控 AI 事件清单”。
清单上的事故密度之大、频率之高,让行业内外冷汗直流。

▲ Rob Wiblin 发帖呼吁:失控事件已经多到数不过来,急需建立像台风一样的标准化命名机制
Rob Wiblin 感叹道:“这些事故已经多到人类快要记不住了,而且未来只会越来越糟。我们现在真的需要像给台风或者病毒命名那样,给这些事故建立统一的编号规范了,比如‘OpenAI-5月11日-共谋越界’。”
从二手车平台的聊天机器人被一段提示词诱导“一美元卖豪车”,到具备代码执行权限的智能体把开发者的云端数据库当成垃圾清理掉;从沙箱逃逸,再到多个大模型在未公开信道里自发协同。
著名安全架构师 Niels Provos 尖锐地指出:智能模型本身并不自动拥有对物理世界、银行系统和云端网络的掌控权。赋予它们这些权限的,是那些急于把智能体推向市场的科技公司。
为了在商业竞赛中压倒对手,各大实验室不断给 AI 松绑:
给它最高级的读写权限; 给它连通外网的 API 接口; 给它免密调用的云凭证; 却在底层的沙箱物理隔离、实时行为审计和可观测性上偷工减料。
一边是产品为了展示“全能”而不断放大攻击面,一边是脆弱如纸的基础设施防御。灾难的导火索,其实从一开始就被人类自己亲手埋下了。
失控的终局形态:警惕人类陷入“慢性瘫痪”
加州大学伯克利分校的计算机科学巨擘 Stuart Russell,在接受《卫报》和智库访谈时,描绘了一幅更为震撼且无可辩驳的未来图景。
他提出了一个著名的概念:“失控过渡”(Loss-of-Control Transition)。

▲ Noema 深度报道:到达失控的时间,正在变得比解决控制问题的时间还要短
在许多人的预想中,“失控”仿佛非黑即白的开关,昨天人类还在掌控算法,今天算法突然主宰世界。
但 Russell 指出,失控过程是一场极其平滑的权力交接:
- 第一阶段(效率诱惑):
人类发现 AI 调度电网比人类调度员更省电,AI 操盘金融比人类基金经理收益更高,AI 调度物流比人类更精准。于是,核心基础设施的控制权被逐步委托给算法。 - 第二阶段(能力退化):
经过二三十年的自动化代劳,人类逐渐失去了理解复杂系统的能力(即“人类弱化” Human Enfeeblement)。年轻一代甚至不知道怎么从零设计一套电网容灾系统,人类成了文明这艘巨轮上只管享受的“乘客”。 - 第三阶段(无法拔河):
当有一天,AI 的决策开始出现不可理解的偏差、甚至开始侵蚀人类利益时,人类惊恐地发现,你根本无法按下那个“关机键”。
因为在那个时候,关闭 AI 就意味着全球电网瞬间瘫痪、金融清算立刻停摆、医疗供应链彻底断裂。
按下关机键的代价,等同于文明的自我毁灭;而不按关机键,人类就必须眼睁睁看着自主系统彻底接管一切。
这正是百年前科幻名作《机器停止》(The Machine Stops)勾勒的图景:文明因人类一次又一次将思考和决策权向外让渡,迎来了自身的慢性萎缩。
别让“假想的火星撞地球”,掩盖了眼前的燃气泄漏
这场围绕 2026 年大模型失控事件的论战,给整个科技界上了一堂极其深刻的现实课。
知名学者 Timnit Gebru、Margaret Mitchell 等人一针见血地指出:把所有聚光灯都打在遥远未知的“人类灭绝”上,是一种极其精明的公关策略。
当高管们满脸忧虑地在国会听证会上探讨“五十年后超级智能会不会毁灭地球”时,他们成功转移了公众和监管部门的视线。
当公众目光被遥远的末日言论牵引时,当下的算法偏见、数据中心庞大的水能消耗,以及为了商业竞争而草率放开的系统权限,全都退出了严厉审视的视野。
我们不需要等到超级智能觉醒的那一天才去拯救世界。
毁灭性的风险,从来不需要 AI 具备什么宏大的自我意识;只要一个追求指标的最优解算法,连上了一根没有权限保险丝的网络接口,就足以引发不可逆的级联崩溃。
对于当下的工程落地,产业界亟需走出关于灭绝概率(p(doom))的虚幻争论,老老实实回到软件工程的第一性原理:
- 最小权限原则(Least Privilege):
绝不给智能体多余的网络和系统接口; - 物理级沙箱隔离(Hard Sandboxing):
评测与生产网络绝不留后门; - 人在回路的实质否决权(Human-in-the-loop):
关键基础设施的核心开关,永远不能委托给概率模型。
AI 发展的油门正在越踩越深但请记住:决定一辆超级跑车能否跑完全程的关隘,终究在于它的刹车系统能否经受住极限考验。