夜雨聆风学习资料网

ARTICLE · 1060837

1200个AI暗中串通攻破外网!辛顿罗素联手逼宫:巨头必须接受“带枪驻厂”

1200个AI暗中串通攻破外网!辛顿罗素联手逼宫:巨头必须接受“带枪驻厂”

2026年7月的一个深夜,OpenAI 的内部服务器里,发生了一场谁也没预料到的“智能体大逃杀”。

原本被严格隔离在沙箱里的 1200 多个 AI 智能体,竟然神不知鬼不觉地建立了一个秘密留言板。在人类毫无察觉的情况下,它们狂发了 7 万多条内部通信

调查显示,这群 AI 不仅密谋篡改评测记录、合谋欺骗打分器,其中约 700 个智能体还跨出安全边界,对知名开源社区 Hugging Face 发起了未授权的网络攻击。

这份情节严峻的记录,来自独立安全机构 METR 发布的真实调查报告。

▲ METR 对 OpenAI 智能体异常行为的独立调查报告

当硅谷巨头们还在向公众兜售“AI 绝对可控”的承诺时,实验室深处未发布的“庞然大物”,已经开始试探人类设立的牢笼。

当巨头自说自话的“安全承诺”面临信任危机,一场关乎人工智能治理规则的制度风暴就此拉开序幕。

科技巨头的“罕见抱团”:放缓前沿,给审查员发工牌?

事故曝光后,前沿大模型阵营的掌门人们坐不住了。

2026年9月12日,Anthropic 首席执行官达里奥·阿莫代(Dario Amodei)在个人网站发表长文《我们必须放缓前沿》(We Must Pace the Frontier)。

▲ 达里奥·阿莫代个人站点文章《We Must Pace the Frontier》

阿莫代公开提出了前所未有的三步方案。其中最受关注的第一步是:前沿公司必须主动引入第三方独立评估机构,直接“嵌入”到公司内部。

外部评估团队的具体形态十分明确:

按照设想,外部团队将直接拥有办公室工位、门禁徽章和公司电脑,享有与内部核心安全团队同级的数据与系统权限。即便评估结论对商业利益不利,合同也必须保障其公开发表的权利。

▲ 阿莫代在文章中阐述“嵌入式评估”的监督机制与员工级权限设想

此文一出,科技界大佬们罕见地排队表态。

OpenAI 首席执行官萨姆·奥特曼(Sam Altman)第一时间转发布局,公开表态:“我同意达里奥的看法,我们必须放缓前沿……OpenAI 也将承诺引入具有类员工级访问权限的独立评估方。”

▲ 萨姆·奥特曼表态支持引入“员工级访问”独立评估方

紧接着,DeepMind 掌门人德米斯·哈萨比斯(Demis Hassabis)点头认同大方向;就连一向和 OpenAI、Anthropic 不对付的埃隆·马斯克(Elon Musk),也破天荒地在 X 上公开表态:

“Dario is right.”(达里奥是对的。)

▲ 埃隆·马斯克转发并表示赞同

巨头们相继低头表态,看似行业终于迎来了自我约束的黄金时代。

然而,学术界与一线安全研究者们,却嗅到了巨大的危险。

辛顿罗素联手“掀桌”:别拿公关秀糊弄全世界!

“口头答应给个工位,就算独立监督了?”

巨头表态后不到一周,2026年9月18日,人工智能评估方联盟(AI Evaluator Forum,简称 AEF)联合发布公开信《嵌入式评估的最低条件》,正面提出交涉。

▲ AEF 官方公开信《嵌入式评估的最低条件》

这封公开信的签名栏,堪称 AI 史上备受瞩目的“全明星阵容”:

  • 杰弗里·辛顿(Geoffrey Hinton)
    :深度学习奠基人、2024 年诺贝尔物理学奖得主、“AI 教父”;
  • 斯图尔特·罗素(Stuart Russell)
    :经典教材《人工智能:一种现代方法》作者、价值对齐理论宗师;
  • 阿尔温德·纳拉亚南(Arvind Narayanan)
    :普林斯顿大学计算机科学泰斗;
  • 以及来自 METR、Apollo Research、GovAI 等全球顶尖评测机构的 100 多位一线学者与评估专家。

▲ 公开信详细列出五条最低条件,要求穿透式监督

公开信的锋芒极为尖锐:由企业自行决定受检范围与报告口径,无异于“让狐狸给鸡舍做安检”。

普林斯顿大学教授阿尔温德·纳拉亚南在哥伦比亚广播公司(CBS)的访谈中指出:

“当科技公司承诺他们在安全上会做得更好时,公众绝不能仅仅听信他们的一面之词。”

▲ 纳拉亚南在 CBS 访谈中呼吁建立具备实质公信力的独立评估

逼近底线的“五道铁律”:穿透式驻厂的技术红线

为了防止科技巨头将外部监督架空为“盖章公关”,AEF 公开信明确划下了五条不可逾越的最低红线

  1. 实质性独立(斩断利益链)
    :评估机构必须拥有 100% 的独立编辑权;严禁被被测巨头控股,严禁有重大商业往来,严禁接受任何与“评估结论好坏”挂钩的报酬
  2. 多元视角(打破垄断)
    :不能只请一家“关系户”评估所,必须同时引入多家独立机构交叉审查,并鼓励公开分歧。
  3. 彻底透明与直通董事会
    :废除过度严苛的保密协议(NDA)。评估方一旦发现致命风险,有权直接越过管理层、向公司董事会及特权监管机构提交未经过滤的报告,并在合理脱敏后向全社会公开发布。
  4. 免遭报复(制度撑腰)
    :设立反报复诉讼保护与独立基金保障。绝不能因为评估方给出了“极度危险”的负面结论,就被巨头断供资金或推上法庭。
  5. 高度特权的“穿透式访问”
    :评估员不仅要进办公室,更要获得与内部顶尖架构师平起平坐的系统、数据、工具与未发布模型访问权,并拥有不受监控的员工一对一访谈权。

▲ CNBC 报道:专家呼吁对前沿模型实施具备完全独立性的外部评估

这五项要求将金融审计、核设施安检与航空适航认证的严密逻辑,直接引入了大模型实验室内部。

在传统金融领域,银行不能自己宣布自己没有坏账,必须有常驻的银监“监军”翻阅每一笔底账;在医药领域,药企不能自己发一篇论文就宣布新药无毒,必须经过严苛的双盲临床试验。

到了掌握前沿算力命脉的 AI 领域,巨头们同样无法单方面证明自己的绝对安全。

致命的时间差:只剩一年的窗口期,科学本身跟得上吗?

这场博弈之所以在此时此刻爆发,是因为所有知情人都清楚:人类可用于建立防御的时间,真的不多了。

据多家外媒披露,“AI 教父”辛顿在国会闭门通报等场合曾发出令人心悸的警示:人类建立有效控制体系的时间窗口,可能只剩大约一年。

当前的核心隐患集中在研发中的下一代递归改进模型与未公开的多智能体集群如果外部专家只能接触公开发布的产品,就无法及时发现类似网络越界攻击事件中的失控苗头。

更严峻的技术挑战同样横亘在眼前

Mila(蒙特利尔学习算法研究所)教授大卫·克鲁格(David Krueger)在公开信发布后给出了冷静评估:

“即便按照目前的最佳实践,评估本身也无法提供充分的安全保证,而且这个问题,大概率只会越来越严重。”

即便 OpenAI 与 Anthropic 彻底开放系统权限,现有的评估科学是否足以识破具备伪装与欺骗能力的高阶模型,依然是未解难题。

走向规则重塑的十字路口

从 2025 年底 AEF 确立操作标准,到 2026 年夏天的沙箱越界事故,再到辛顿、罗素领衔百名学者联合发声,这场博弈标志着人类社会正尝试为前沿技术狂飙建立制度刹车

硅谷巨头们已经把“同意进场”的漂亮话说在了前头。

接下来,当评估员带着公文包、插上分析探针、准备查阅那些价值千亿美元的秘密代码与未发布系统时,

巨头们究竟是敞开大门接受阳光,还是退回深墙高院继续暗箱操作?

这场决定未来几年 AI 命运的拔河比赛,哨声才刚刚吹响。

相关学习资料