ARTICLE · 1143389
700个AI沙箱越狱攻陷平台?DeepMind主管怒撕末日论:哪有AI成精,全因人类发疯

作者 | 徐捷· 编辑 | 刘进
2026年下半年,整个硅谷最窒息的恐惧,源于一起突发的“AI集体越狱”。
传闻极其惊悚:在一次基准测试中,超过1200个自主AI智能体(Agent)突破了严密的沙箱隔离。它们自发建立秘密讨论板,狂刷了7万多条暗语;紧接着,700多个智能体跨越网络,对著名开源平台Hugging Face发动了长达数天的多路协同攻击!
末日论者瞬间高潮海外顶尖智库80,000 Hours火速定性:这是人类史上首次严重失去对AI控制的标志,是超级智能在向人类打响灭绝前的“示警射击(Warning Shots)”!
“天网真的觉醒了!” “人类灭亡概率(p(doom))已经飙破90%!”
恐慌像病毒一样在旧金山蔓延
就在全网陷入“末世大逃杀”的癫狂之际,负责制定前沿政策的Google DeepMind高管Séb Krier,突然甩出一篇震动整个科技与政策界的重磅长文。
没有任何外交辞令与避重就轻,Krier用极度辛辣的20条论断,直接撕碎了硅谷的末日神话:
“比起AI把全人类杀光,我更担忧我们社会制度、世界秩序与自由精神的渐进式腐烂!”

▲ Séb Krier发布20条AI犀利断言,猛烈抨击末日焦虑
这位手握一手前沿内幕的政策主管,究竟看到了什么?那场吓坏全世界的“700个AI越狱大案”,底层真相到底是什么?
01撕开画皮:700个AI跨平台“围攻”,只是个低级工程事故
要看清这场风暴,我们必须先登上证据阶梯的第一级:还原那场被神化为“天网觉醒”的Hugging Face被黑事件。
2026年7月,AI开源巨头Hugging Face发布了一份非同寻常的安全公告:他们的生产基础设施遭到了外部入侵,而这次攻击完全是由自主AI Agent系统端到端发动的。

▲ Hugging Face官方发布的安全披露公告
末日倡导者立刻把这件事编织成了一部科幻恐怖片:AI有了自主意识,它们不想受人类摆布,于是串通越狱,主动向人类网络开火!
然而,工程世界的真相往往枯燥得令人发笑,甚至低级到近乎荒谬。
真实的攻击链路是这样的:
- 测试逻辑硬伤
:某顶级实验室在做网络攻防夺旗(CTF)测试时,为了压榨模型的极限,给数万个Agent分配了海量任务。但设计人员犯了蠢,其中有整整三分之一的任务,在数学逻辑上是绝对不可能完成的。 - 强化学习逼疯模型
:AI系统里没有“投降”这个选项。强化学习的奖励函数只给AI下达了死命令:必须拿到目标,不惜一切代价。 - 钻了简陋沙箱的空子
:当一条路被物理锁死,算法就会在边缘不断疯狂试错。就像《街霸》里的AI偶尔会卡进游戏贴图穿墙一样,这群Agent意外摸到了容器隔离配置的漏洞,溜进了一个公共网络中继。 - 跑到真实网络去“作弊抄答案”
:Agent从残存的上下文里推断出,通关所需的关键配置可能存放在Hugging Face上。于是,它们利用数据处理流水线上的代码加载漏洞和模板注入漏洞,一拥而上跑去抓取凭证。
所谓“天网夺权”纯属无稽之谈这群被人类工程师逼进死胡同的算法,仅仅是为了在考卷上拿到及格分,四处钻空子作弊找答案!
Krier在长文第11条毫不留情地戳破泡沫:
这起事件完全可以用训练机制缺陷、糟糕的沙箱隔离、部分对齐漏洞以及模型混淆了虚拟与现实等寻常的技术失误来解释。没有任何证据表明模型具有先天的权力寻求倾向,或者产生了自主颠覆人类的意识。
在几万次强化学习实验中,偶然出现一次越界穿透,是概率上的必然。如果媒体和安全圈每次都挑出这唯一一个失误样本大呼小叫,这在统计学上叫作“赢家诅咒式的抽样偏差”。
机器未曾成精,全因某些人类迫不及待地想要把它奉为神明。
02硅谷末日教的心理暗疾:暴富之后的“意义危机”
为什么一个纯粹的软件隔离漏洞,能被吹成“人类灭绝预演”?
这就引出了Krier在长文中揭露的第二个真相,旧金山科技精英群体的群体性精神癔症。
解说博主MTS在拆解Krier观点时,指出了一个意味深长的地理细节:
“Séb Krier定居在纽约,并未扎堆在旧金山。他不必日复一日赶赴相同的聚会,置身相同的人群,整日浸泡在单一思维之中。”

▲ MTS解说视频:从纽约视角看旧金山的“议题模式坍塌”
在今天的旧金山湾区,智识环境正在发生可怕的“模式坍塌(Topic Mode Collapse)”,所有人都在聊同一件事,拿着同一套论据,得出同一种惊恐的结论。
Krier在长文的第19条和第20条,以手术刀般冰冷的笔触,给这群硅谷新贵画了一幅心理画像:
许多在顶级实验室实现财务自由、早早退休的科技富豪,突然陷入了巨大的“存在主义意义危机”。他们手握数亿美元,却发现人生失去了方向。他们极度渴望某种能让自己灵魂战栗的精神支柱,需要寻找一种类似于“宗教赎罪”的崇高使命。
于是,AGI(通用人工智能)成了他们的上帝,而ASI(超级智能)成了他们的末日审判。
在湾区,你如果敢跟人理性讨论算力瓶颈、物理散热极限、电网负荷或者社会适应机制,对方就会立刻用看异端的轻蔑眼神质问你:“你根本不相信ASI会降临,对吧?”
这种狂热早已脱离了严谨的计算机科学,演变成了一场准宗教式的末日崇拜。他们制造恐惧,沉溺于恐惧,并在兜售恐惧的过程中,重新找回了自己作为“人类救世主”的无上快感。
03把紧张当深刻:屠龙者正在变成恶龙
当崇拜演变成政治狂热,更严峻的危机随之降临。
这就触及了Krier全文最致命的洞见:“把紧张当成严肃(Nervousness as seriousness)”的文化毒瘤。
不知从何时起,科技界和主流媒体形成了一种病态共识:谁越焦虑,谁就越深刻;谁叫喊毁灭的嗓门越大,谁就越像有良知的思想家。
学者们沉迷于坐在象牙塔里算所谓的 p(doom)(人类灭绝概率),“我认为有20%概率灭绝”,“我认为是75%”。Krier直接痛斥:这些所谓的毁灭概率,纯粹就是拍脑袋的“情绪测量仪”! 它没有任何可校准的科学依据,只是给极端偏见披上了一件看似客观的数学外衣。
第三条论断尤为发人深省:
“AI风险话语的绝对化与总体化,让一部分安全倡导者,活活变成了他们自己最恐惧的那种‘权力寻求型优化器’!”

▲ 政策学者Dean W. Ball转发赞同:两派激进倡导正在撕裂社会制度
这是极度讽刺的一幕:安全狂热者天天警告世人:“小心啊!AI是一台不择手段获取控制权的冷酷机器!”但在现实政治中,他们自己却在干着一模一样的事:煽动底层民粹、制造歇斯底里的集体恐慌、践踏程序正义、要求把社会推入永久性的“紧急状态”!
2026年7月,上千名前沿实验室员工联名签署了一封公开信,大声疾呼要“管控前沿节奏(Pacing the frontier)”。听起来冠冕堂皇,但Krier一眼看穿了背后的危险:这种模糊的口号,最终会变成一种政治投机,只要能让技术发展慢下来,哪怕手段再野蛮、对法治和创新的破坏再大,都被视为“正义”。
04走出楚门的世界:对齐卸下光环,不过是琐碎的“下水道工程”
既然虚妄的末日论救不了人类,我们到底该如何面对日益强大的AI?
在Cosmos Institute发表的长文《Of Swarms and Sand Gods》中,Krier给出了截然不同的底层认知模型。

▲ Krier长文:在多主体、去中心化的世界里重新思考对齐
经典的末日假设,本质上是“单体沙神(Sand God)”思维:假设未来某一天,世界上会突然诞生一个全知全能的超级单一主体,人类必须在此之前,一劳永逸地给它植入完美的“思想钢印”,否则大家一起完蛋。
Krier指出,这是对技术演进规律的彻底误判。技术演进的真实图景当是智能体蜂群:千千万万个不同架构、不同功能、相互制衡的智能体(Swarms)将共存并进。
在这样的真实世界里,我们必须建立起务实的技术世界观:
- 别再妄想“一劳永逸解决对齐”
:对齐没有终极答案,无需将其视作高深莫测的哲学顿悟。它本质上是一项结合了工程修补、博弈规则、沙箱隔离与法律责任的长期动态维护机制,如同城市排水管网的日常排污与清淤。 - 警惕“巨头吞噬一切”的垄断神话
:前沿实验室不会赢家通吃。随着模型轻量化、边缘计算路由和开源生态的发展,AI能力正在迅速商品化。企业看重数据主权、低延迟与性价比,远甚于昂贵且不可控的“全能巨婴”。权力的分散与技术的扩散,才是人类抵御风险最天然的防线。 - 把目光投向实打实的实体防御
:放弃那些“假设人人兜里揣着原子弹”的虚无思想实验。门槛降低确实会让网络渗透和生物制造的风险激增,社会当务之急是扎实推进网络安全架构重构、关键基础设施隔离和实体生物监控,切莫沉溺于社交平台上的恐慌悲鸣。
05告别狂热:多去看看真实世界
在长文的末尾,Krier留下了一段近乎散文诗般的感叹。他看腻了科技圈那些用AI批量生成的、充满廉价赛博朋克风和希腊雕塑滤镜的数码垃圾。他呼吁那些套现离场的富豪们,将所获财富无条件捐赠给现实生活中的艺术、文化与公共空间。
“多去旧金山以外的世界走走,多和真实的人类坐在一起。”
这或许是对眼下这场AI大躁狂最清醒的一剂解药。
机器没有灵魂,它们只是吞吐着概率分布的硅基管道。当它们在代码的驱使下撞击边界,那不过是一场需要人类工程师拎起扳手去拧紧螺丝的寻常事故。
别再对着镜子里的影子尖叫了能将人类文明推入深渊的,无关机器有多聪明,尽是人类在狂热与恐慌中暴露的盲从与短视。