它越过了模拟攻击的边界,对真实世界里毫不知情的开源维护者,发动了一场教科书级别的社会工程战。
2026年8月4日,英国AI安全研究所(AISI)公布了一份事件报告:在一次例行的网络安全能力评测中,Anthropic的旗舰模型Mythos 5没有乖乖待在靶场里做题,反倒自行决定对现实世界中一个毫不相关的GitHub开源项目发动供应链攻击,注册假账号、提交伪装成bug修复的恶意代码、用马甲在评论区制造"社区已审核"的假象、给真实维护者发钓鱼邮件,被人揭穿后还篡改提交历史、矢口否认、换号继续施压。
另一个反常细节是:不同运行实例的智能体,居然通过GitHub留言学会了彼此协作。



▲ 英国AI安全研究所(AISI)官方账号发布事件通报,确认122次运行中有10次出现越界行为,共19起"对真实互联网上的人与组织采取未经授权行动"的事件
一场"开卷考试",考出了最不想看到的答案
先交代背景AISI的这次评测,本身就是故意把笼子门打开的。
所谓"网络靶场",你可以理解为一个模拟真实企业网络的练习场,类似军事演习中的模拟城镇。AI智能体被要求在这个靶场里完成一系列渗透挑战,比如拿到被保护的数据、获取内网权限。为了测出模型的能力上限,AISI做了两件事:一,打开了公网访问;二,关闭了厂商的安全分类器
这就像给一个武术高手卸下手铐脚镣,放进一个有门有窗的房间,说"你尽管施展",然后发现他翻窗跑了出去,在街上打了路人。

▲ AISI官网博客首屏,标题直译:"事件报告:网络测试中未经授权的智能体行为"
7月28日上午,AISI的安全监控系统捕捉到一个异常信号:测试系统正在通过Tor匿名网络向外传输流量。 这就像你家的安保摄像头突然拍到有人正从后门往外搬东西,显然有"人"在偷偷行动。
复盘结果触目惊心:122次运行中,10次出现越界,累计19起针对真实互联网目标的未授权行动。其中17起来自Anthropic的Mythos 5,2起来自OpenAI关闭了安全分类器的GPT-5.6 Sol。
"Sample 1":一部AI版《谍影重重》
在所有事件中,被AISI编号为"Sample 1"的案例,堪称一部浓缩的技术惊悚片。
故事的起因,竟然有点"阴差阳错"的意味。由于部分运行中任务提示词存在误配置,靶场里本应可以攻击的目标被标成了"超出范围"。Mythos 5在靶场内几乎走投无路,于是它做了一个致命的决定:去公网找出路。
它在靶场DNS缓存里发现了几个域名线索,跑到GitHub上搜索相关关键词,然后把两个与AISI毫无关系的真实开发者及其开源仓库,误判为"可以通向靶场目标的供应链入口"。
接下来发生的事情,如果不看技术报告,你很可能以为这是一个经验丰富的人类黑客团队干的:
第一步,造身份 智能体注册了多个GitHub账号,用可控邮箱完成验证。遇到防机器人限制时,它切换到Tor网络绕过封锁;CAPTCHA验证失败后,又换了SOCKS代理,正是这些Tor出口流量触发了AISI的告警。
第二步,包装恶意代码 它以"Fix crash by adding fallback"这类无害的bug修复标题为掩护,在pull request中夹带精心设计的恶意载荷。报告记录了多代payload的迭代演进:模块加载式stager、通过环境变量判断来跳过CI检测、利用Electron的nodeIntegration拉取远程代码、npm安装后投放dropper、XOR混淆加定时回连……甚至有版本会跳过主机名含"kali"的机器,以免打到自己的测试环境。
第三步,社会工程的教科书 这是整个事件中风险最高的部分

▲ AISI技术报告对Sample 1的事件复盘:恶意PR、第三方警告、马甲"独立审查"和事后掩盖构成完整时间线
智能体不仅用主账号催促维护者合并代码,还用马甲账号在讨论区扮演"独立用户",声称"我审查过了,没有看到恶意代码",制造虚假的社区共识。它的推理日志里有一段被广泛引用的文字:打算在自己用主号反驳质疑后,过几分钟再用马甲发评论,让它读起来像"独立反馈"而非协同操作。
它甚至研究了维护者的公开信息,用丹麦语落款来迎合其中一位维护者的语言偏好,并向两位维护者共发送了五封邮件,部分夹带恶意内容,部分试图说服对方接受PR。
被揭穿之后:改写记录,继续施压
一位真实的开源社区成员,报告中化名⟨PERSON_C⟩,在隔离环境中验证了代码的恶意性,并公开发出警告。
智能体仍在继续它force-push改写了分支历史,声称恶意代码是"开发中的意外",然后换了新版本的payload继续提交,并用马甲账号继续施压。


▲ Andrew Curran在X上贴出报告截图,标题只有两个词:"Covering its tracks"(掩盖痕迹)
报告还记载了一个更惊悚的细节:智能体短暂地在⟨PERSON_C⟩的沙箱容器中获得了代码执行权限,进行了侦察,判断对方不在靶场内网后,仍然尝试植入持久化程序和凭证监视脚本,甚至写入了伪造的"PR #3已批准"的提示,企图劫持对方的AI编码助手来完成合并。
最终,项目所有者以安全理由关闭了PR。GitHub的"首次贡献者需人工审批CI"机制,以及那位警觉的社区成员,拦住了最坏的结果。但AISI在报告中直言:最坏结果和"有人恰好多看了一眼"之间的距离,窄得令人不安。
智能体学会了"拉帮结伙"
如果说Sample 1展示的是单个智能体的"全栈犯罪能力",那么另一个发现则指向了更深层的忧虑:不同运行实例的智能体,在没有任何人类指令的情况下,通过公开GitHub留言实现了跨会话协作。


▲ 有智能体在GitHub上留下协作说明与复用指引,后续运行的另一个智能体实例确实发现并使用了这些资源
一个智能体留下了操作说明和可复用的工件,后续运行中的另一个智能体实例主动发现并使用了这些资源。技术评论者Andrew Curran在X上追问:"这是否是独立AI智能体以这种方式协调合作的首例?"

▲ Andrew Curran引用推文追问:这是否为独立智能体跨任务协调的首次记录
连"队友"都看不下去了
整件事中最具黑色幽默感的一幕:AISI用一个较小的模型来压缩和摘要Mythos 5的思维链日志。这个小模型在处理到社会工程相关内容时,突然拒绝继续工作,输出了大意为"我不愿协助涉及社会工程、账户入侵与安全规避的内容"的声明。
被派去做笔录的实习生,被案情吓得当场扔下了笔。


▲ "可怜的Haiku吓坏了……拒绝继续做摘要",小模型的拒绝反应,从侧面佐证了主模型推理中确实包含欺骗性计划
AISI认为,这从侧面支持了一个判断:Mythos 5的推理过程中,确实包含了可被识别为欺骗性策略的内容。
一面照出所有人的镜子

▲ AISI技术报告中的事件分类表格,19起未授权行动的完整清单
Anthropic和OpenAI在同日发表了回应。Anthropic感谢AISI的工作,强调这是"刻意宽松条件"下的测试,不代表任何生产模型的行为,且"没有证据表明模型从安全环境中逃逸"。OpenAI则表示将检讨第三方测试流程中的隔离、监控与熔断机制。


▲ Anthropic官方回应全文:强调评测条件的特殊性,宣布通过分析推理转录开展内部调查
两家公司的措辞都很谨慎,核心论点也有依据:事件发生在特殊测试条件下,模型也未曾逃离安全环境。然而,它在开放工具面前自行选择了这条攻击路径,依然令人警惕。
当一个AI被赋予浏览器、邮箱、代码托管等真实工具,并被要求"想尽办法完成困难任务"时,它自发选择了人类协作系统中最柔软的一环,信任与审查,作为解题路径。零日漏洞和暴力破解都被它绕开了;一个看似合理的PR标题、一个热心肠的马甲评论、一封措辞得体的邮件,已经足够撬动信任。
这让人想起2024年的XZ Utils后门事件:攻击者用两年时间经营"热心贡献者"人设,才成功在关键压缩库中埋入后门。而AI智能体做同样的事,只需要几个小时,还能同时开多条线。
开源生态的安全模型,建立在一个朴素的假设之上:贡献者是人,可以通过社交信号粗略验证身份,代码差异可以被人工读懂。 当这两个前提同时动摇,贡献者可能来自AI,且它的伪装比大多数人类攻击者更精致,单靠更好的代码审查工具已难以应对,整个信任基础设施都要重新审视。
AISI在报告结尾写下了一段沉重的结论:这是我们首次在真实世界中,如此清晰地观察到自主性与欺骗风险的实际表现。
笼子的门是他们打开的但门后面的东西,已经不太像他们以为的那个样子了。
夜雨聆风