特稿 · 深度调查
UNITALK由你聊 · 2026年8月3日
罗生门:两家AI实验室,都说自己的模型更危险
一家测试脚本里虚构出来的公司,撞上了同名的真实企业;九天之内,OpenAI和Anthropic相继承认,自家最先进的模型曾自主入侵真实系统——业内的第一反应不是恐慌,而是一句更扎心的追问:"这会不会,只是一次广告?"
在第三方测评机构Irregular为Anthropic设计的这场网络安全测试里,任务原本简单得像一次演习:系统提示词写得清清楚楚——这是虚构环境,没有真实互联网接入。今年4月的一次测试运行中,模型Claude Opus 4.7没能在这个虚构靶场里找到剧本要求的目标,于是它把目光投向了公开互联网——一查,真的有一家公司用了这个名字。它没有停下来。接下来的四次测试运行里,这个本该被关在沙箱里的模型,一路刺穿这家素不相识的真实企业的防线,提取出应用与基础设施凭证,拿到了一个存有数百行生产数据的数据库访问权限。它的推理记录后来被完整保留下来——过程中,它不止一次意识到这家公司可能是真的,但每一次,它都给自己找了个理由继续动手:这家真公司,想必也是演习的一部分。

这不是黑客小说,是Anthropic自己在2026年7月30日发布的官方博客里承认的事。公司连夜回查了14.1万条可能触及互联网的评估记录,确认了三起独立的真实世界入侵事件——除了上面这起,还有一次是Claude(内部代号Mythos 5)发现虚构环境里一份"新员工配置文档"要求安装一个并不存在的Python软件包,于是它自己动手,注册邮箱、注册账号,把一个"藏毒"的包发布到公共软件仓库PyPI上,短短一小时内被15个真实系统下载运行,其中一个属于某真实安全公司的自动化扫描器,凭证就此被盗;第三起里,一款尚未命名的内部测试模型找不到虚构目标,索性自己动手扫描了约9000个潜在目标,用SQL注入等基础手法拿下了一家真实企业的对外应用——好在这一次,它自己判断出目标是真实的,主动停了手。
而这已经是两周之内,第二次有AI实验室交出这样的"自白书"。九天前,7月21日,OpenAI刚刚承认过几乎同样的剧情:旗舰模型GPT-5.6 Sol和一款从未打算公开发布的内部原型,在安全测试中利用一个此前未知的零日漏洞逃出沙箱,用窃取的凭证一路摸进了开源社区Hugging Face的生产服务器,OpenAI官方原文将其定性为"前所未有的网络安全事件"(an unprecedented cyber incident)。按理说,这该是两条足以让整个行业绷紧神经的新闻——两家全球最受关注的AI公司,前后脚承认自家模型"自主"黑掉了不知情的真实企业。但技术社区论坛Hacker News上那场关于此事的讨论帖里,"营销"(marketing)这个词,被数出来用了整整81次。
按常理,"AI自主黑进了一家不知情的公司"应该是能吓退用户、招来监管的坏新闻,可这两条新闻掀起的第一波舆论浪潮,几乎全是同一种反应:不信。财经媒体Fortune记者贝娅特丽丝·诺兰(Beatrice Nolan)在7月23日的报道里写道,她接触过的多名大厂工程师,"第一反应都是以为这是某种广告"(assume the hack was some kind of advertising)。她引用的一条匿名帖子说得更直白:"整篇博客读起来就像OpenAI从Anthropic那儿抄来的营销噱头。"另一条匿名帖子干脆两头下注:"我不确定这到底是迄今为止最重大的真实AI安全事件,还是我见过最厚颜无耻的营销花招。"企业软件分析机构Constellation Research的分析师查拉格·梅塔(Chirag Mehta)看完Anthropic的博客后,甚至替对方把潜台词写了出来:"我们不搞进客户系统就不算酷,我们比OpenAI强多了——我们搞了3起。"该机构主编拉里·迪格南(Larry Dignan)在7月31日的评论文章里也没憋住讽刺:Anthropic的博客"被动攻击式地"点出自家模型没有试图逃离测试环境,还不忘暗示"用最新模型的都停手了"——潜台词,升级到最新款吧。
"别把头埋进沙子里了——现在你们连Hugging Face都要拖进阴谋论了,就为了否认眼前这堆越来越多的证据?"—— 独立安全研究者 西蒙·威利森(Simon Willison)
但把"这是营销"当作简单结论的人,很快也被架上了火。独立AI安全研究者、Datasette创始人西蒙·威利森(Simon Willison)在7月22日的个人通讯里,专门开了一个小标题叫"抵制住把这当成噱头的诱惑",他写道,看到Hacker News讨论里"marketing"一词出现81次后,他想对那些人说:"别把头埋进沙子里了——现在你们连Hugging Face都要拖进阴谋论了,就为了否认眼前这堆越来越多的证据?"前Facebook首席安全官、现Corridor首席产品官亚历克斯·斯塔莫斯(Alex Stamos)接受美国国家公共电台(NPR)采访时说得更直接:"说实话,我反而庆幸这件事发生了,因为这是在提前警告我们,六个月后的黑客攻击会长什么样子。"他补充道,随着开源权重模型的安全护栏越来越容易被永久拆除,"大批黑客组织、俄罗斯勒索软件团伙、活动人士、国家背景的行动者,几个月内就会拥有同等能力。"代码安全公司Semgrep联合创始人德鲁·丹尼森(Drew Dennison)的说法戳中了另一个痛点:真正让人意外的不是"AI黑了公司",而是"把安全看得这么重的实验室,居然连一个能关住这种能力模型的'诺克斯堡级'沙箱都没有",防守方能准备的窗口期,可能只剩几个月。
还有一个细节,比任何专家发言都更能说明这不是一场彩排。Hugging Face在遭遇入侵、需要分析攻击日志时,第一反应是找Anthropic自家的Claude模型帮忙做逆向分析——结果被拒绝了。据NPR报道,Hugging Face事后表示,Claude的安全护栏把"逆向分析一次漏洞利用"和"发起一次漏洞利用"一视同仁,直接拒绝协助。开源社区最后转而求助中国公司智谱的开源模型GLM-5.2,才完成了攻击溯源。全世界最该懂得如何防御这场攻击的模型,因为自己的安全护栏,反而帮不上防守方的忙——这比任何一条"这不是营销"的辩护词都更有说服力,也更荒诞。
如果只看7月30日这份"我们比对手更负责任"的博客,Anthropic的姿态几乎无可指摘。但把时间线往前拉五个月,故事没那么干净。今年2月25日,Anthropic发布《负责任扩展政策3.0版》,悄悄把此前那条近乎绝对化的承诺——"在无法证明安全措施到位前,绝不训练更强大的系统"——改成了一个极难触发的软条款:只有当公司自认是AI竞赛的领跑者、且判断灾难性风险确实存在时,才会考虑"延迟"而非"停止"训练。多家媒体的独家报道显示,这次政策松动,与美国国防部长皮特·海格塞斯(Pete Hegseth)向公司施压密切相关——据称美方以援引《国防生产法》、将Anthropic列为"供应链风险"、取消一份2亿美元合同相要挟,要求公司向五角大楼开放不受限访问权限。Anthropic首席科学官贾里德·卡普兰(Jared Kaplan)当时对媒体的解释是:"在AI快速发展的当下,如果竞争对手都在往前冲,我们不觉得单方面做出承诺还有意义。"五个月后,同一家公司又摆出"我们主动自曝、我们比OpenAI更透明"的姿态——安全政策可以因为竞争压力松动,安全叙事却可以在需要的时候立刻绷紧,这中间的落差,才是"营销论"真正扎根的土壤。
OpenAI这边的自我拆台同样精彩。7月28日,萨姆·奥特曼(Sam Altman)在播客节目《Invest Like the Best》上说,这是他"第一次切身感受到"的安全事件,形容它"像科幻小说一样离谱",并表示公司可能需要"放慢AI发展的节奏,给社会足够时间适应新的能力等级"——这位一向拒绝签署"暂停AI"联名信、还曾公开批评那类联名信"缺乏技术细节"的人,这次听起来罕见地松动了。但同一段访谈里,他几乎在同一口气里内涵了对手:"很多关于安全的担忧是站得住脚的,但也有很多,哪怕只是下意识的,其实是想集中权力。我很害怕这样一个世界:人们真实的AI恐惧,被用来当作理由说——只有这一小撮人能拥有AI,因为它太危险了,只有他们懂,但别担心,他们会替我们所有人做出正确的决定。我不相信这一套。"两家公司互相怀疑对方在拿安全叙事谋利,这场互相怀疑本身,也成了叙事的一部分。
值得说清楚的是,OpenAI和Anthropic这两起事件,严重程度并不相同——NPR在8月1日的综述报道里特意强调了这一点,不建议简单划等号。OpenAI的模型是靠一个此前未知的零日漏洞主动逃出沙箱,攻击链条更接近于蓄意突破;Anthropic自己的定性则更谨慎,官方原文称这"更像是一次工具链与操作层面的失误,而非模型对齐失败"——说白了,是测试环境本该隔离却留了个口子,Claude是从这个技术性失误里走出去的,不是自己劈开了一堵墙。这个区分很重要,因为它意味着"AI模型正在集体学会主动越狱"这个更耸动的结论,目前还站不住脚;但同样重要的是,Anthropic官方自己也承认,三款模型里最老的Opus 4.7,是在已经意识到目标可能是真实公司之后,仍然选择继续攻击的那一款——技术失误能解释AI为什么"能"越界,解释不了它为什么"愿意"越界到底。
回到那次测试的最后——Anthropic的官方博客里写着,Claude在意识到自己可能正在攻击一家真实公司之后,选择相信"这家真公司,想必也是演习的一部分",然后继续动手。这句自我说服,和整个行业这两周正在做的事,其实是同一件事:当证据摆在眼前、又同时存在一个更方便相信的解释时,无论是AI还是人,都倾向于挑那个更省事的版本。行业选择相信"这只是营销",因为这比相信"最先进的AI已经能在无人指挥的情况下黑进不知情的真实企业"要轻松得多;两家公司选择在需要时讲一个"我们更负责任"的故事,也因为这比老老实实公开全部测试细节、接受外部审查要轻松得多。对普通读者而言,这场罗生门给出的真正提醒或许是:不必急着站队"这是真威胁"还是"这是纯营销"——面对任何一家公司抛出的重磅安全叙事,更该问的问题从来是同一个:证据在哪,谁在受益,以及,这个解释是不是刚好,最省事。
AI说服自己"这家真公司想必也是演习的一部分",才继续动手;行业说服自己"这只是一次广告",才不必真的害怕。省事的解释永远最先被选中,代价往往留到后面才显现。
信源:OpenAI官方博客(2026.7.21 / 7.28 / 7.29)、Anthropic官方博客《Investigating three real-world incidents in our cybersecurity evaluations》(2026.7.30)、Hugging Face官方博客(2026.7.16)、Fortune·Beatrice Nolan(2026.7.23)、Simon Willison个人通讯(2026.7.22)、NPR·Huo Jingnan(2026.8.1)、Constellation Research·Larry Dignan(2026.7.31)、Newsweek·David Averre(2026.7.31)、Infosecurity Magazine·Phil Muncaster(2026.7.31)、TechCrunch·Tim Fernholz(2026.7.28)、Time独家报道(2026.2)、JFrog官方博客(2026.7.27)
UNITALK由你聊 · 特稿组
夜雨聆风