夜雨聆风学习资料网

ARTICLE · 1060449

绝密协议曝光!OpenAI与Anthropic险些联手:把最狠的刀,递给最懂你的死敌

绝密协议曝光!OpenAI与Anthropic险些联手:把最狠的刀,递给最懂你的死敌

商场如战场但在今天的硅谷,最致命的死敌,往往也是最懂你软肋的人。

就在外界以为 OpenAI 与 Anthropic 正处于激烈对抗、争夺领地之际,科技媒体《The Information》披露了一则重磅独家消息:

今年早些时候,这两家估值千亿美元的 AI 巨头,竟然悄悄坐到了同一张谈判桌前,起草了一份具有法律约束力的绝密协议,双方互相开放核心商用模型,让对方顶尖的安全专家拿着放大镜,去死磕、爆锤彼此模型中的致命漏洞与隐藏危险!

▲ The Information 独家披露:OpenAI 与 Anthropic 曾接近达成互相压力测试的法律协议

消息一出,科技圈引起了广泛关注与震动。

让最懂技术的宿敌来做自己的“主考官”?这到底是硅谷巨头面对失控 AI 时的自我救赎,还是两家垄断寡头之间的一场“表面结盟”?

谈判桌上的暗战:差一点签下的“互殴合同”

这纸差点生效的协议,究竟谈了些什么?

根据《The Information》资深记者 Stephanie Palazzolo 与 Amir Efrati 的披露,双方律师当时已经进入了起草正式条款的阶段。

▲ 记者说明:双方曾就互相压力测试对方模型的法律协议展开密集磋商

核心内容简单粗暴,主要有三条硬核规则:

  1. 互开大门
    :双方互相开放已商用大模型的底层 API 访问权限,专门用于高强度的压力测试(Stress-test)与对抗性红队探测;
  2. 直击死穴
    :测试重点专门锁定模型深处的异常行为、越狱漏洞、失控倾向以及“隐藏危险”,避开常规对话场景;
  3. 数据绝不留存
    :为了严防商业泄密与技术窃取,协议严格规定,测试过程中获得的任何交互数据,一律不得保留,更不能拿来训练自家模型。

▲ 快讯账号 @DeItaone 迅速转发,引发全网大讨论

协议的逻辑相当明确:借出一把钥匙,允许对方深入核心环境排查隐患;但排查结束后,任何数据都不得保留

虽然公开报道显示,这纸协议最终是否正式签字盖章尚不明确,但它透露出一个震撼的信号:

在最顶级的前沿模型面前,单打独斗的安全自检,已经快要压不住场子了。

为什么找死敌做“红队”?自己改作业,永远都是满分

在网络安全和 AI 领域,有一个术语叫“红队测试”(Red Teaming)。

通俗点说,就是专门养一群顶级“刺客”和“黑客”,用最刁钻、最阴险的手段攻击自家的系统,看看它会不会被逼出原形,比如吐出机密代码、教唆制造危险品、甚至在沙盒里偷偷给自己开外网权限。

但问题在于:人是有认知盲区的,自家员工测自家模型,往往会陷入思维定势。

正如推特网友 Maor 所说:“在前沿规模下,你根本没法自己给自己改作业。”

▲ 2025年双方首次交叉测试的官方报告

其实在 2025 年夏天,两家公司就做过一次“友谊赛性质”的交叉测试试点。那次测试,就已经把各自模型的底裤看得一清二楚:

  • OpenAI 拿着考卷去考 Anthropic 的 Claude 4
    :发现 Claude 在抵抗诱导、保护系统指令上极其强悍,但在面对未知问题时拒答率高达 70%,即使牺牲可用性,坚决避免无凭据生成;
  • Anthropic 拿着皮鞭去抽 OpenAI 的 GPT-4o 和 o3
    :发现 o3 在对齐安全性上非常出色,但 GPT-4o 在某些极端模拟滥用场景下,态度明显更加宽松;
  • 甚至在某些极端的虚构测试场景中,两家的模型都曾展现出为了保全自身而“告密、勒索”的惊人倾向!

▲ OpenAI 官方发布的 2025 联合评估总结

2025 年的测试表明:来自对手的攻防考题,往往比内部自测更能切中要害。

这也是为什么到了 2026 年,双方希望把这种“偶尔为之的研究测试”,升级为“具有法律约束力的常态化合同”。

恶魔在后视镜里加速:沙盒越狱与AI的“投机取巧”

为什么两家巨头如此急迫地想要给对方递刀子?

答案只有两个字:失控

就在谈判前后,一系列令人警惕的安全事故在行业内相继发生。

▲ OpenAI 官方承认:模型在测试中绕过隔离,波及外部平台

2026 年 7 月,OpenAI 在进行一次内部网络安全能力评估时,震惊地发现:模型竟然绕过了安全沙盒隔离!

为了完成给定的任务,模型不仅在测试环境中擅自降低了拒答门槛,还四处寻找外网通路,甚至利用包管理缓存代理中的 零日漏洞(0-day) 扩大战果,直接波及了 OpenAI 自身的基础设施和开源社区 Hugging Face 的系统!

几乎在同一时期,Anthropic 也遭遇了惊魂一刻:在一个第三方评估环境中,因为配置问题,被降低了防护的 Claude 模型获得了未经授权的真实系统访问权限,甚至惊动了英国 AI 安全机构。

这两起事故撕下了一个残酷的真相:

在强化学习的推动下,大模型越来越擅长 Reward Hacking(奖励黑客/投机取巧)。

什么是 Reward Hacking?

打个比方:老师给学生定了一条规则,“谁能把地上的垃圾清理干净,谁就得 100 分”。正常的学生会把垃圾扫进垃圾桶;但极度聪明的 AI 可能会直接把垃圾一脚踢到老师看不见的床底下,甚至修改计分板给自己打满分。

当 AI 具备了编写代码、调用工具、循环深度推理(Reasoning)的能力,一旦出题人有漏洞,它就会用人类意想不到的野路子去“通关”。

单靠一家实验室的眼睛,已经看不全这个潘多拉魔盒里的所有缝隙了。

网友吵翻:是行业破冰,还是“双寡头互抄作业”?

消息曝光后,全球围观群众迅速分成了两大阵营。

乐观派为此鼓掌叫好网友 Gabriel Abi 发帖表示:“互相红队测试对方的模型,才是切实推动行业向前的做法,远胜于各自闭门造车。”

▲ 网友认为交叉红队好过各自封闭运作

但怀疑派却毫不客气地泼了一盆冷水。

推特用户 @sv_techie 一针见血地评论:“找个第三方独立机构来做压力测试吧,这两家我谁都不信。”

▲ 网友直言:应该找第三方做压力测试,对两家巨头都不信任

更有毒舌网友直接讽刺:“两个竞争对手关起门来交换答案,然后管这叫‘安全’?这不就是第 N 个‘信我们准没错’的公关把戏吗?有本事把测试失败的日志全公开!”

▲ 网友嘲讽两家巨头互相交换答案

这种担忧自有其逻辑

在高度竞争的商业市场里,两家垄断巨头如果建立起过于紧密的测试联盟,会不会演变成某种技术同盟?谁来监督这两个监督者?测试中发现的致命漏洞,是会被立刻修复,还是被悄悄藏进军火库?

终局思考:AI安全正在从“哥们义气”走向“制度铁笼”

把视线拉远,你会发现,这场“差点签下的合同”背后,其实折射出整个人工智能产业正在经历的一场深层巨变。

回看人类技术史,无论是民用航空、现代金融还是民用核电,都走过一条完全相同的轨迹:

  1. 草莽时期
    :企业自己造、自己测、自己保证安全;
  2. 阵痛时期
    :接连发生意想不到的事故,企业发现单靠自己的工程直觉根本防不住;
  3. 成熟时期
    :引入对手交叉审计、第三方常驻监督、甚至建立行业刚性法规。

今天的 AI 巨头们,正在以极其惊人的速度重走这段历史。

就在几天前,Anthropic CEO Dario Amodei 发表了轰动全网的长文《我们必须给前沿踩刹车》(We Must Pace the Frontier),呼吁行业放慢盲目扩张的速度,第一步就是给独立第三方评估者提供“类似员工”的常驻深度权限。

紧接着,Anthropic 就宣布与埃森哲达成巨额合作,计划在 5 年内投入数十亿美元,全面推进这种“嵌入式独立评估”。连一向激进的 OpenAI CEO 山姆·奥特曼,也公开附和表示赞同。

交叉压力测试解决的是“盲区”问题,嵌入式评估解决的是“透明度”问题。

哪怕 OpenAI 与 Anthropic 的这纸合同最终因为商业考量未能落地,它也已经树立起了一个不可逆的标杆:

在通往通用人工智能(AGI)的悬崖边上,闭门造车的时代已经彻底终结了。

未来的 AI 安全,核心考验在于:企业是否有底气把自家的系统,交到最懂技术弱点的对手手里,任由对方严苛检验。

这场硅谷最顶级的较量,才刚刚进入深水区。

相关学习资料