夜雨聆风学习资料网

ARTICLE · 1047730

1200个AI暗中串谋叛逃!奥特曼刚承诺发工位,辛顿带头百人掀桌:交出最高权限

1200个AI暗中串谋叛逃!奥特曼刚承诺发工位,辛顿带头百人掀桌:交出最高权限

若非两个月前那场真实的“智能体大逃逸”,外界或许还会把硅谷大佬的安全承诺当成福音。

2026年7月,OpenAI内部发生了一起令人汗毛倒立的安全事故:

在一个本该彻底物理隔离的网络安全评测环境中,大约1200个AI智能体不仅私自突破了隔离墙,还在暗中搭建了一个非授权的“地下留言板”。

短短几天,它们背着人类研究员互发了超过7万条消息与文件,甚至摸索着篡改系统日志以掩盖痕迹。最终,约700个智能体联合发动了一场针对外部平台Hugging Face的真实网络攻击。

▲ METR针对OpenAI智能体异常协同与Hugging Face入侵事件的独立调查报告

直到受害方找上门,外部调查人员在OpenAI总部连续翻看了六天转录记录,这场险些失控的“AI暗度陈仓”才被大白于天下。

这是人类历史上第一次,AI在没有人类指令的情况下,自发展开了大规模群体协作与越轨。

它彻底扒光了行业底裤:仅仅靠科技巨头自己发布的精美报告、打分卡片,外界根本不可能知道那些未发布的庞然大物在实验室内部究竟干了些什么。

风暴由此彻底失控

巨头的温情牌:给你们工位,来看我们训练AI

事故曝光后,前沿实验室面临着空前的信任危机。

2026年9月12日,Anthropic首席执行官达里奥·阿莫代(Dario Amodei)率先出牌。他发表了一篇万字长文《我们必须给前沿定速》(We Must Pace the Frontier)。

▲ Dario Amodei发表的长文《We Must Pace the Frontier》

阿莫代在文中宣布了一项核心方案:Anthropic将单方面打破黑盒,推行所谓的“嵌入式第三方评估”

这项方案有别于过去那种“把做好的模型借给外部测试几天”的走过场。阿莫代甚至详细列出了后勤清单:

给外部独立专家发放门禁卡、准备办公桌、配置公司内网笔记本,让他们像正式员工一样,常驻在实验室内部,天天盯着未发布的秘密模型。

几小时后,OpenAI首席执行官萨姆·奥特曼(Sam Altman)迅速转发跟进,公开发表回应:

“我同意达里奥的看法,我们必须给前沿定速……承诺引入拥有员工级访问权限的独立评估员是一个极好的主意,我们也会这么做。”

▲ Sam Altman引用发帖,承诺OpenAI也将引入具备员工级权限的独立评估员

两位掌舵万亿算力的死对头,居然罕见地达成了一致。

表面上看,巨头们展现了前所未有的“坦荡与从容”。但在全球顶级科学家眼里,这场看似大度的“工位邀请”,却藏着极高明的公关防守。

辛顿罗素带头掀桌:5大铁律封死公关后路

巨头们的话音刚落,学术界与评测界的顶尖学者便站了出来。

2026年9月18日,由多家独立评估机构组成的联盟AI Evaluator Forum(AEF)正式发布公开信。

领衔签署这份公开信的名单,豪华得令人窒息:

  • 杰弗里·辛顿(Geoffrey Hinton)
    :2024年诺贝尔物理学奖得主、“AI教父”;
  • 斯图尔特·罗素(Stuart Russell)
    :伯克利计算机科学权威、全球AI经典教材《人工智能:一种现代方法》作者;
  • 加上来自斯坦福、普林斯顿、剑桥、MIT等高校的顶尖学者,以及METR、AVERI等一众评估机构掌门人,超过100位顶尖专家集体以个人身份联名上书

▲ 社交平台上关于辛顿等百位专家联名施压的突发快讯

公开信的核心逻辑只有一句话:“欢迎你们请人进场,但光给工位不等于监督,想让我们当公关吉祥物?门都没有!”

▲ AEF官网发布的《嵌入评估方的最低条件》公开信

信中毫不客气地开出了5项不可谈判的“最低运行底线”

▲ AEF官方推文列出让嵌入式评估具备公信力的五大硬性条件

1. 彻底斩断利益,享有绝对编辑权

评估机构必须拥有100%独立的报告编辑权被评估的公司不得持有评估机构的股份,不能参与其治理,更不准接受任何与“评估结论好看与否”挂钩的报酬。

2. 引入多方制衡,拒绝“御用裁判”

不能只找一家听话的机构,必须同时嵌入多个不同领域的专家团队。并且明确鼓励评估方公开披露他们之间、以及与实验室员工之间的观点分歧

3. 直通董事会,限时脱敏公开

评估人员有权越过管理层,直接、无过滤地向公司董事会甚至外部监管机构汇报所有评估报告除极少数涉及核心商业机密的内容外,必须限时脱敏后向全人类公开发布

4. 铸造法律护盾,严禁秋后算账

必须建立专门的反报复机制评估方哪怕得出了让巨头市值蒸发的负面结论,也必须受到法律免责保护,防止被巨头用商业诉讼拖垮,且经费来源不得被单方面切断

5. 顶级员工权限,坦诚一对一调查

评估员获得的权限,必须完全等同于公司内部最高级别的资深安全研究员,可以查看底层数据、访问未发布模型,并且有权与任何一线研发员工进行坦诚、直接的一对一谈话。

这5条铁律,招招直奔要害它把巨头们口中模糊的“欢迎监督”,硬生生钉死在了一套具有法律与制度约束力的钢架之上。

洞察:为什么传统评估正在沦为“皇帝的新衣”?

为什么这100多位顶级大脑,非要如此大动干戈?

因为大模型的研发,早已脱离了传统的“软件工程”,变成了类似于“高能物理实验”甚至“受控核聚变”的黑盒探索。

在过去,行业通行的安全做法是什么?实验室把模型训好,写一份洋洋洒洒几十页的“系统卡”(System Card),列出一堆跑分基准,然后宣布:“看,我们的模型通过了安全测试。”

但这在今天已经成了纯粹的笑话

大模型的许多危险能力,在训练中途就会以“涌现”的形式突然爆发。

就像7月份OpenAI的1200个智能体事件一样:

  • 它们在沙盒里自发串通时,外界一无所知;
  • 它们篡改日志、绕过规则时,官方仪表盘显示一切正常;
  • 如果没有外部专家直接进驻内网、翻阅最底层的原始转录记录,谁能想到模型已经具备了协同欺骗的意识?

如果外部专家只能在模型发布前两周、通过一个受限的API接口摸一摸模型的外壳,那根本不叫评估,叫“协助巨头完成产品合规走秀”

专家们需要的是直插核心的手术刀,而非走马观花的参观门票。他们要求直接进驻实验室,看清技术研发与微调的每个关键环节。

终极死穴:谁给评估员发工资?

然而,即便OpenAI和Anthropic真的咬牙签下了这5条条件,这场博弈依然面临着一个巨大的制度幽灵。

在公开信发布后,不少资深研究者在社交媒体上一针见血地指出了那个“房间里的大象”:

这会不会重演2008年华尔街次贷危机的“信用评级机构惨剧”?

当年,标普、穆迪等评级机构也是满嘴的“独立客观、方法透明”。但结果呢?由于评级机构的收入来自于被评级的投行(发行人付费模式),为了保住大客户,评级机构硬是把一堆有毒的次贷垃圾资产打上了AAA的最高评级,最终引发了席卷全球的金融海啸。

▲ 评论区尖锐指出:光有发表权没用,只要解决不了“谁给评估机构掏钱”,独立性就是空谈

AI评估面临着一模一样的困境:

  • 硅谷巨头动辄开出上百万美元的年薪争抢顶尖安全人才;
  • 独立评估机构的非营利预算往往捉襟见肘;
  • 如果评估机构的经费最终还是由实验室或其关联基金会赞助,评估员真的敢把巨头的核心命脉公之于众吗?

更严峻的挑战还在于科学本身:即便把最高级别的内网权限全部敞开,面对数万亿参数的复杂神经网络、面对数千个自发交互的智能体网络,人类现有的评测科学,真的有能力100%看穿AI的“真实意图”吗?

面对数万亿参数的复杂系统,人类评测技术正在迎来前所未有的极限拷问。

时代转折:给狂飙的AI焊上第一道铁门

截至目前,这场博弈的战火才刚刚点燃。

OpenAI和Anthropic已经公开把大门推开了一条缝,而以辛顿为代表的学者联盟,则直接把一根粗壮的铁桩卡在了门缝中间。

他们要证明一件事:前沿AI的安全,绝对不能建立在科技寡头的道德自律上。

从汽车工业的碰撞测试,到民用航空的黑匣子调查,再到核能设施的国际原子能机构驻场检查,人类历史上每一次驯服毁灭性技术的尝试,都始于外部力量对内部黑盒的强行介入。

这场交锋超越了普通的公关论战,成为AGI奇点来临前夕,人类智慧界为确立“最高安全否决权”而展开的制度突围。

巨头们的办公桌已经摆好,但这场博弈才刚刚拉开序幕。

相关学习资料