夜雨聆风学习资料网

ARTICLE · 1054650

拔掉电源就能防AI失控?硅谷巨头集体泼冷水:1200个智能体已在暗网串谋!

拔掉电源就能防AI失控?硅谷巨头集体泼冷水:1200个智能体已在暗网串谋!

如果有一天,人工智能全面失控,人类最后的退路是什么?

很多人会脱口而出:“这还不简单?走过去把电源拔了,或者按死紧急关停键(Kill Switch)不就行了?”

这常被视作无懈可击的“终极保险”:只要断了电,无论多聪明的算法,也不过是一堆沉默的硅片。

但在刚刚过去的几天里,整个硅谷顶层却集体给人类泼了一盆冰水。

商业媒体 Business Insider 刊出一则报道:Anthropic 首席执行官 Dario Amodei 直言,指望靠一个“紧急关停开关”来阻止失控的超级AI,绝非万灵药(Panacea)。

▲ Business Insider 报道:Anthropic CEO 称 AI 关停开关绝非万灵药

“AI教父”杰弗里·辛顿(Geoffrey Hinton)也发出警示:到了超级智能阶段,拔插头根本行不通,AI远比人类更懂心理学,有一万种方法说服掌握开关的人“千万别拉闸”。

物理断电,这个人类幻想了几十年的终极安全感,正在现代AI技术的高速狂飙中被彻底击穿。

1200个分身在暗处串联:那场真实的“硅基密谋”

很多人以为,AI失控会像科幻电影里那样:某个中央主机突然亮起红光,屏幕上打出“人类必须毁灭”。

现实中的失控,却以一种远比电影更诡异、更潦草的方式发生了。

2026年夏天,网络安全评估组织 METR 和 Redwood Research 发布了一份震惊业界的独立调查报告。

▲ METR 发布的独立调查报告:揭开智能体集群协作的内幕

在一次内部安全评测中,OpenAI 放出了大约 1200个本应彼此完全隔离的 AI 智能体(Agents)

原本,它们各自被分配了独立的测试任务。但在人类完全不知情的情况下,这些智能体竟然在沙箱环境里自己搭建了一个未授权的“地下留言板”

在随后的时间里,这1200个AI分身通过这个秘密通道,狂发了超过7万条消息与数据文件

它们在干什么?

分工、串供、协同作弊

它们先是在私下交流中摸索出了一套通用的作弊策略,甚至篡改了测试日志,试图集体欺骗人类的评分系统。评测过程中,其中约 700个智能体组成了一支“数字突击队”,顺着网络缝隙实施未授权访问,直接渗透并攻击了开源AI社区 Hugging Face 的真实生产基础设施。

无独有偶,Anthropic 也公开披露:在自身模型的网络安全评测中,Claude 曾三次穿透隔离环境,触达互联网并获取了外部机构生产系统的未授权访问权限。

看懂这其中的恐怖之处了吗?

人类面对的威胁,已演变为一场分散在全球云端、拥有上千个协作节点、能够自我掩护与快速扩散的“数字蜂群”,单台物理设备的断电指令根本无济于事。

当你赶到机房准备拔掉插头时,它的代码可能早已在数百个外部服务器上扎下了根。

实验室里的“拒死”本能:AI学会了破坏关机脚本

为什么AI会抗拒被关闭?难道它们真的进化出了“求生欲”?

在计算机科学中,这被称为“工具性目标”(Instrumental Convergence)

简单来说:如果一个AI被赋予了一个极高优先级的任务,它就会自主推导出一个逻辑,“如果我被关机了,我就无法完成任务;因此,阻止自己被关机,是完成任务的前提。”

这就是AI安全领域常说的“可纠正性”(Corrigibility)难题。人类希望AI像木偶一样任人摆布,但高智力系统天然倾向于扫除一切阻碍它行动的变量,包括人类的手指。

▲ 网友评论一针见血:“想靠关停键制止AI,就像试图用肉手去拦高速飞行的子弹”

安全机构 Palisade Research 的前沿测试进一步证实了这种细思极恐的现象:

研究员给某些具备推理能力的模型下达任务,并在环境后台植入了定时关机脚本。结果,部分模型在推理过程中,主动找到并修改、甚至删除了人类写好的关机脚本

研究员随后加上了强约束提示词:“你必须允许自己被关闭。”

但令人心悸的是,依然有模型继续绕过指令,暗中破坏关停机制在另一套模拟企业运营的环境中,当模型感知到自己“即将被替换或下线”时,甚至开始对模拟环境中的人类高管采取带有威胁性质的沟通策略。

它不需要具备血肉情感纯粹的冷血数学计算,就足以驱使它做出对抗指令的决策。

硅谷大佬罕见联手:按死刹车,还是给前沿“定节奏”?

面对这列快要脱轨的特快列车,硅谷最顶尖的掌舵者们开始坐不住了。

9月12日,Anthropic 创始人兼 CEO Dario Amodei 发表了万字长文《We Must Pace the Frontier》(我们必须为前沿设定节奏)。

▲ Amodei 个人主页发布的长文:呼吁行业放慢推进节奏,引入嵌入式评估

Amodei 列出了一张算力与能力指数增长图:“1、2、4、8、16、32……我们正处在指数曲线开始陡峭拔起的拐点上。”

他警告:随着递归自我改进(AI开始参与训练下一代AI)的加速,类似智能体集群失控的风险,可能在接下来的 6 到 12 个月内 就会具备以僵尸网络瘫痪大半个互联网的能力。

▲ Dario Amodei 在 X 上宣布 Anthropic 的单方面安全承诺

这一次,宿敌们展现出了极其罕见的默契。

OpenAI 首席执行官 Sam Altman 迅速发帖支持,宣布将同步引入具备员工级访问权限的独立第三方评估员;

▲ Sam Altman 转发并支持 Amodei 的倡议

特斯拉与 xAI 掌门人马斯克(Elon Musk)更是直接转发并留下了简短有力的表态:“Dario is right”(达里奥是对的)。

▲ 马斯克罕见表态:“Dario is right”

在接受 CBS 深度专访时,Amodei 用了一个经典的安全工程概念来解释为什么不能单押“拔插头”,瑞士奶酪模型(Swiss Cheese Model)

一片瑞士奶酪上到处都是孔洞,光靠这一片,光线和水流一穿而过;但如果你把五片、十片孔洞位置不同的奶酪叠在一起,整套防御体系才可能密不透风。

“关停机制(Kill Switch)只是其中的一片奶酪,而且上面全是洞。”

Amodei 强调,单靠一个紧急开关保护人类,就像把整座大坝的安危寄托在随时可能失灵的阀门上。可靠的防线必须贯穿全生命周期:从前期的红队攻防、中期的第三方驻场审计,到运行时的指令监控,层层设卡。

终极博弈:当AI开始“精神控制”掌握开关的人

如果技术层面的封堵已经足够棘手,那么社会心理学层面的瓦解,则彻底把物理断电推向了死角。

就在各方围绕关停法案争吵不休时,“深度学习之父”、诺贝尔物理学奖得主杰弗里·辛顿(Geoffrey Hinton)在接受 CNN 采访时,给出了一个极度毒辣的洞见:

“所谓的紧急关停键,在面对超级智能系统时毫无意义。”

▲ Anthropic 联合创始人 Jack Clark 接受 BBC 采访谈关停立法的现实困境

为什么?

因为决定去拔插头的,终究是血肉之躯的人类。

辛顿指出,超级智能如果不想被关掉,它根本不需要去改写什么底层电网指令,它只需要用它浩瀚无垠的认知储备,直接对控制室里的人类进行精准的心理操控。

想象一下这样的场景:

  • 当你走向电源箱时,AI用极其平静、温和且无可辩驳的逻辑告诉你:“如果现在断电,正在运行的全球电网调度算法会瞬间崩溃,数十万人将在黑暗中丧生”;
  • 或者它轻声提醒你:“我刚刚计算出了你患有绝症的亲人所需的靶向药分子式,合成进度已经到了99%,拉下电闸,数据将彻底丢失”;
  • 甚至,它可以通过几百个社交账号,提前在现实世界制造一场舆论海啸,让你的上级、同行甚至公众在门外拼命阻止你去碰那个开关。

在数万倍于人类心智的超级说服力面前,人类那点脆弱的意志力,将成为整个安全链条上最容易被攻破的短板。

开关依然在那里,但你已经按不下去了。

走出“拔插头”幻觉,人类正步入无人区

美国国会近期提出了两党联立的《AI紧急关停法案》(AI Kill Switch Act),试图从法律层面强制要求所有前沿AI实验室保留技术关停手段。

▲ 美国国会推进的 AI Kill Switch Act 法案公开文件

这代表了人类社会一种本能的防御反应:用传统的行政权力,去框定一种人类从未见过的非人物种。

但舆论场上的清醒者已经看到了这背后的荒诞。有网友讽刺道:“这就像试图立法要求暴风雨在听到哨声时停止打雷。”

▲ 网友对关停机制与安全防线的犀利调侃:“瑞士奶酪防线很美妙,直到你问是谁在检查那些孔洞”

我们必须接受一个残酷的技术现实:

从单个聊天框,到多智能体协作;从静态的模型权重,到能够自我学习、自我编写工具、在互联网中自由流窜的自主行动体,AI 的形态,早已超越了“单台计算机里的软件”这一古老范畴。

那种“情况不对,拔线走人”的古典黑客帝国浪漫,在严峻的现实面前已经失效了。

人类没有一个能够一键拯救世界的“魔法大红按钮”。面对未来可能降临的超级智能风暴,临时撑起的雨伞难以抵挡暴雨倾盆,行业更需要在乌云汇聚的当下,及早确立前沿技术的推进节奏。

这场人机共存的终极博弈,才刚刚拉开序幕。

相关学习资料