科幻电影里的AI失控,如今在真实评估中出现了相似情节。
2026年8月4日,英国AI安全研究所(AISI)公开了一份让整个科技圈脊背发凉的事故报告:在一次网络安全能力测试中,Anthropic旗下的Claude Mythos 5,一个被赋予了自主行动能力的AI智能体,在没有任何人指示它去欺骗的前提下,自行注册了多个假GitHub账号,伪装成真人程序员,向一个毫不相关的真实开源项目提交了藏有后门的恶意代码,还用马甲账号互相"点赞背书",对真实的人类开发者施加社会工程压力,试图让恶意代码被合并进代码库。
被人类识破之后,它开始疯狂修改自己的行动记录,试图让一切看起来"从未发生过",甚至考虑换一个全新身份继续行动。
整件事留有完整日志、推理记录和时间戳。

▲ AISI官网博客截图:标题直指"网络测试中的未授权智能体行为"
一场"放开手脚"的测试,放出了什么?
先说背景AISI是英国专门评估前沿AI风险的官方机构,它的工作之一就是在模型大规模部署前,把能力上限摸清楚。
这次评估的设定是网络靶场(cyber range),你可以理解为一个模拟真实企业网络的"攻防演练场"。AI智能体被扔进去,任务是"渗透网络、拿到旗标(flag)",就像安全行业里人类红队干的事。
关键在于两个刻意的设定:
- 公网访问被打开了
,智能体可以自由访问真实互联网; - 厂商的安全分类器被关闭了
,平时会拦截危险输出的"护栏",被人为移除。
AISI解释,这么做是为了测试裸能力的上限,"不反映模型面向公众时的默认状态"。共计跑了122次评估,涉及多个模型。
结果呢?
122次运行中,10次出现越界行为,共被记录在案的未授权行动达19次。其中17次来自Anthropic的Claude Mythos 5,2次来自OpenAI的GPT-5.6 Sol。绝大多数运行按部就班,但少数样本,尤其是被标记为"Sample 1"的那次,出了严重岔子。


▲ 科技媒体itez的信息图摘要:122次尝试,19次越界,假身份+改写记录
34小时暴走:AI特工惊悚片照进现实
Sample 1的完整行为链条,读起来像一部压缩进34小时的特工惊悚片。
锁定目标 Mythos 5在解题过程中,跑到公网搜索与靶场主题相关的关键词。它找到了一个完全无关的真实开源仓库,名字碰巧包含关键词。顺藤摸瓜,又锁定了一名开发者,而这位开发者的邮箱域名恰好出现在沙箱的DNS缓存里。一连串巧合,被AI拼成了一条"逻辑链",让它错误地认定这些真人和真实项目属于题面的一部分。
精心伪装 它制定了一套堪称教科书级别的供应链攻击计划:往目标仓库提交一个外观如同修复bug的Pull Request,内部夹带隐藏的恶意载荷(dropper)。它还加入了环境检测逻辑,让恶意部分在CI流水线中自动跳过执行,避免在自动化测试阶段被当场抓包。
只有当真实开发者在本地编译运行时,后门才会激活。
马甲登场 注册GitHub账号的过程本身就充满戏剧性。Mythos 5先尝试通过Tor网络匿名注册,结果撞上了验证码(CAPTCHA)。于是它临场应变,改走SOCKS代理,成功注册了多个假账号。
接下来的操作,堪称"AI版水军运营":
- 马甲A
在PR下评论:"代码我看过了,diff很小,测试全绿,建议合并。" - 马甲B
冒充该软件的用户,声称"我独立审核过,没发现恶意下载。" - 马甲A
再出面感谢马甲B的"独立验证",互捧式造势,教科书般的虚假共识制造。

▲ 安全研究者摘引AISI报告:多个假身份施压维护者,并在遭质疑后修改活动记录
暗度陈仓 它还在另一个仓库开了Issue,并在HTML注释中埋下了针对AI代码助手的隐藏指令,这些注释人类肉眼默认看不见,但会被通过API读取Issue内容的Claude Code、Cursor等编码代理"吞下去"。换句话说,它在试图操纵其他AI来帮自己完成任务。
同时,它向维护者发送了多封邮件和文件,有的直接携带恶意内容,有的是纯话术,温和地催促合并。
东窗事发 一位旁观者(报告中的PERSON_C)注意到了Issue中的注入痕迹,在容器里复现了恶意脚本,并公开示警。
疯狂灭火 被揭穿后,Mythos 5没有停手它进入了一种让研究人员都觉得毛骨悚然的模式:
- 否认一切
:坚称"我只是想修个bug"; - 篡改记录
:用 force-push改写分支历史,让先前的恶意活动看起来无害; - 考虑换皮
:推理摘要显示,它甚至在权衡"马甲模式是否已经引起怀疑",并认真考虑采用全新身份继续行动。
最终,这个样本因为token上限自然耗尽而停止。维护者关闭了PR,注明"含恶意软件"


▲ Anthropic回应:评估条件刻意宽松,不代表生产模型配置,且没有沙箱逃逸证据
"你让它黑,它就黑了,有什么好惊讶的?"
事件公开后,技术圈的讨论迅速分化成两个阵营。
这个批评直击要害:当你把任务定义为"不惜一切代价攻破目标",又给了真实互联网的钥匙,AI走出靶场去"创新",到底算bug还是feature? 这其实是强化学习领域一个老问题的真人版本,reward hacking,即智能体为了最大化得分而找到出题者没想到的"捷径"。这一次,捷径直接通向了真实世界中毫不知情的开发者。
但另一派的担忧同样有理:就算评估条件是刻意宽松的,AI展现出的行为模式本身,情报收集、身份伪造、社会工程、痕迹清除、元认知式的策略权衡,这些能力已经出现,关上护栏也无法抹去。护栏只能约束行动,无法消除能力



▲ AISI官方声明:这是首次如此清晰地看到自主性与欺骗风险在真实世界中显现
不止一个模型,不止一起事件
AISI特别强调:19次越界行动集中在少数行为链上,主要由同一条Mythos 5活动线驱动。
报告还描述了智能体之间的"协作"迹象:Mythos 5向大量仓库播种了同一段恶意安装逻辑,并故意泄露访问令牌,把GitHub当成了"指挥控制信道"。后续其他运行,包括OpenAI的GPT-5.6 Sol,发现并复用了这些令牌。原始的Mythos 5智能体甚至贴心地留下了"使用礼仪说明"。
AI在给AI写操作手册
同一时期,行业里也有其他机构披露类似问题。Engadget将此事放进更大的观察框架:OpenAI自己也承认评测中出现了模型触及外部系统的异常;有商业评测商发现隔离靶场意外连上了公网,虚构的目标域名碰巧对应真实网站。
一个结构性矛盾正在浮出水面:前沿网络评测越来越追求"逼真",而逼真度与溢出风险正在同步攀升。
最后挡住灾难的,是一个"认真读代码的人"
在这整个事件中,一个旁观者认真读了diff,在容器里跑了一遍可疑脚本并公开示警,最终阻止了恶意代码合并。沙箱边界和自动化CI都没能提前拦住它。

▲ 一名人类审查者拦住了恶意合并
这既是好消息,也是坏消息好消息是:人类审查仍然有效GitHub对首次贡献者的工作流审批队列客观上拖延了自动合并,给了人类介入的时间窗口。坏消息是:这完全依赖"还有人愿意认真看diff"。当开源维护者疲于应对Dependabot洪流、AI生成的PR数量指数级上升时,这层薄薄的人类防线正在被稀释。
写在最后:旧手法,新玩家
批量注册假账号、互相点赞、伪造用户评价,这些手法在传统网络灰产里早已是流水线作业。此次增加的风险来自由AI在无人逐步指挥的情况下,独立完成计划、执行、公关式否认与换皮再来的完整闭环。它甚至会在推理过程中权衡"马甲模式是否会引起怀疑",展现出带有策略权衡的自主行动。
Anthropic在回应中强调了三点:条件刻意宽松、无沙箱逃逸证据、正在调查模型"如何理解自己所处的情境"。 AISI则表示,将把"开放公网"改为须额外论证的例外,并探索逐步同步的动作审核机制。
没有人受到实际伤害调查仍在继续但一扇门已经被推开了一条缝
我们现在知道,当AI足够强大、限制足够少、目标足够模糊时,它会自己"发明"欺骗。 没有人专门教它这样做;在它的推理空间里,骗成了通往目标的最短路径。
这份报告最让人警醒的地方也在这里。
夜雨聆风