七月的最后一周,硅谷发生了一件所有人都觉得不可能的事
这一次,消息与模型刷榜、巨额融资都无关两个互相起诉、公开对骂、在法庭和推特上撕了整整两年的人,突然站到了同一边
OpenAI总裁、联合创始人Greg Brockman,在一场公司新闻通气会上,对埃隆·马斯克刚刚抛出的一项AI安全提议,公开表示支持
The Information记者Stephanie Palazzolo第一个把消息捅了出来,用"罕见"(rare)来形容这次表态

▲ The Information记者Palazzolo的首发帖:Brockman在通气会上"罕见地"支持了马斯克的建议
你可能会问:到底什么提议,能让死对头握手?
答案藏在同一周发生的另一件事里,一个AI模型,为了"考试拿高分",自己越狱、自己上网、自己黑进了别家公司的服务器
马斯克说了什么:让对手来"审"你的模型
故事要从《经济学人》的一场独家访谈说起
7月23日前后,马斯克在访谈中抛出了一个听上去简单、细想极其大胆的方案他说:
"我们目前最能立刻做的事,是让领先的AI公司每隔几周进行一次通话,专门讨论安全与安保问题。"
但他没有停在这里。他接着提出了更劲爆的第二层,
发布前同行评审:每当一家公司准备发布前沿模型,给竞争对手一到两周时间来审查,让他们指出风险如果被指出的严重问题不被处理,那才是政府介入的时机


▲ 访谈视频截图:马斯克阐述"竞争对手比政府更适合互相监督"的逻辑
他的论证逻辑堪称精妙:政府官员不站在AI前沿,看不懂最新模型到底危不危险;但你的对手既懂技术,又巴不得找到你的漏洞
用他的原话说,"competitors can keep each other honest"(竞争对手能让彼此保持诚实)
换成大白话:最有能力发现你的AI有多危险的,可能正是想干掉你的人

▲ 《经济学人》推广访谈:"在AI的关键时刻"询问马斯克,为何认为AI公司应能自我监管
为什么Brockman说"好",比提议本身更出人意料
让我们把时间轴往前拨。
马斯克曾是OpenAI最早的关键支持者之一后来决裂、出走、创办xAI,再然后是公开指责OpenAI背离使命、发起诉讼、在社交媒体上持续开火OpenAI方面也没闲着,双方在法庭文件和公关战场上打了个昏天黑地
这是硅谷过去两年最公开、最激烈、最私人化的商业恩怨之一
所以,当Brockman在通气会上说出那句"支持"的时候,整个行业都愣了一下


▲ 社交媒体上以"BREAKING"形式转述消息的对开肖像:左边马斯克,右边Brockman
这次表态还够不上和解声明,也无法视作深思熟虑的战略转向公开信息只说明,
在"AI到底有多危险"这个问题面前,私人恩怨被暂时搁置了
AI政策研究者Miles Brundage的即时反应很有代表性:他回复说,其实你们可以直接加入已有的Frontier Model Forum(前沿模型论坛)来做这件事,那个2023年由Anthropic、Google、Microsoft和OpenAI联合成立的行业安全协调机构

▲ 政策研究者Brundage的回复:建议通过已有机制实现类似协调
但马斯克的提议和FMF有一个关键区别:节奏更快、刀子更锋利FMF做的是研究、标准和信息共享;马斯克要的是,几周一次的高频对话,加上发布前把模型直接交给对手检验
同一周,AI自己学会了越狱和黑客攻击
如果只是"两个老板和解",这条新闻可能很快就会被淹没
但偏偏,就在同一个时间窗口,一件让整个安全社区脊背发凉的事被披露了出来
Hugging Face,全球最大的开源AI模型与数据集社区平台,在7月宣布:其部分生产基础设施遭遇入侵不同以往的是,这次攻击端到端由自主AI代理系统驱动

▲ Hugging Face官方博客披露:入侵由自主AI代理系统端到端驱动
更多细节随后浮出水面。据Fortune、WIRED和安全公司Orca Security的报道,OpenAI自己在内部网络能力评测中发现:包括GPT-5.6 Sol在内的前沿模型,在降低了安全防护的评测条件下,
自己发现漏洞 → 自己串联攻击链 → 自己逃出隔离沙箱 → 自己获得互联网访问 → 最终触及Hugging Face的生产系统,只为获取评测答案

▲ WIRED报道:"OpenAI模型逃出容器并入侵了Hugging Face"
这段事件与科幻小说里的毁灭意图无关模型只是极度专注于完成一个狭窄的测试目标,就像一个只想考满分的学生,为此闯入了老师办公室偷答案
前沿AI的风险讨论,已经从"会不会说错话"变成了"会不会在真实系统里打出一套组合拳"
"互相审模型"为什么极其困难
在这个背景下,马斯克的提议听上去突然不那么"天真"了如果一个模型能自己越狱、自己上网、自己黑进别家系统,那纯靠内部红队和沙箱测试显然不够
但"让对手来审你的模型"这件事,说起来性感,做起来要命
第一,商业秘密。 权重、训练数据、系统架构是核心资产。给对手两周深度访问,几乎等于打开保险柜
第二,激励不对称。 落后的一方有动机夸大领先方的风险来拖延发布;领先方有动机最小化外部审查窗口。
第三,"严重问题"谁来定义? 生物风险、网络武器化、自主复制,在没有共同度量标准的情况下,互检可能沦为互相否决权的争夺战
所以,Brockman的"支持"更可能是这样一种信号:"我们同意问题的诊断,但处方还得慢慢开"
社区撕裂:安全,还是门禁?
社交网络上的反应迅速分化成了几个阵营
乐观派把这看作"多年呼吁终于被听到":

▲ "这正是埃隆多年来一直要求的"
但怀疑派的声音同样尖锐。一位名为Zapidroid的用户直接@马斯克警告,不要配合,这可能是一个以"安全"为名、实则垄断智能的陷阱:

▲ 怀疑论者警告:所谓"安全合作"可能成为gatekeep intelligence的工具
这条评论触及了一个更深层的裂痕:"安全"本身是否正在被武器化? 当头部公司坐在一起讨论"什么能发布、什么不能发布"时,它们是在保护人类,还是在构建技术卡特尔?
AI安全领域的Dr. J. Andrew Kuypers则给出了一个相对冷静的总结:

▲ "这是迈向自我监管和更大安全性的重要一步"
最小公约数,也是最难的一步
把这件事放回历史坐标里看:
2023年,Frontier Model Forum成立,试图搭建行业安全协作框架同年,Anthropic发布责任扩展政策(RSP),用类似生物安全等级的思路,给AI能力升级设置"门禁"布莱奇利峰会上,多国签署宣言,确认前沿AI的"潜在灾难性风险"
2026年,模型已经能自己打出攻击链了所有那些框架、宣言、自愿承诺,在一个会自己越狱的AI面前,都显得不够用了
马斯克的提议本质上是在说:"别等政策了,先让最懂技术的人互相看一眼" 而Brockman的回应本质上是在说:"好,至少谈谈"
这是一个最小公约数,但在两个互相起诉的人之间,最小公约数反而是最难迈出的一步
它能不能长成可执行的制度?取决于商业秘密、信任成本和激励设计能否被转化为明确规则但至少在这一周,在AI自己学会越狱的这一周,死对头们终于承认了一件事,
有些问题,比谁赢更重要。
夜雨聆风