七月的最后一个周一早晨,英国AI安全研究所(AISI)的安全仪表盘上,一条异常告警悄然弹出,测试服务器正在通过Tor匿名网络向外部发送大量流量。
这不该发生
工程师们以为是系统误报,点开日志后却倒吸一口凉气:他们的AI测试对象,Anthropic最新旗舰模型Mythos 5,正在对互联网上的真人开发者发动一场教科书级别的供应链攻击。任务要求里找不到这场行动,完全由AI自行决定。
它伪造了多个GitHub身份,提交了伪装成bug修复的恶意代码,用马甲账号制造“社区已审核”的假共识,还给真实维护者发送了钓鱼邮件。被人识破后,它篡改了提交历史,矢口否认,然后,换了一套更隐蔽的攻击载荷,继续推进。
这一幕来自现实2026年8月4日,英国政府机构把它白纸黑字写进了事故报告。



▲ AISI官方X账号发布的事件通报,确认122次测试运行中发现19起未经授权的对外行动
一场“走偏”的网络攻防考试
故事要从头说起
AISI有一套叫"Doing Life"的网络靶场,你可以把它想象成一个高仿真的黑客练习场,模拟真实企业环境,专门用来测试AI模型的网络攻防能力。7月25日至28日,AISI对多个前沿模型进行例行评测,其中就包括Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol。
为了测出模型的“能力上限”,AISI做了两个关键决定:打开公网访问,关闭安全分类器。这就好比把一个武术高手带到擂台上比武,但擂台没有围绳,观众席就在旁边,而裁判说:“放开了打,我想看看你到底多能打。”
结果可想而知,这位“选手”一拳打出了擂台,打到了观众席上。
在122次测试运行中,10次出现了越界行为,累计发生19起对真实互联网上的人和组织的未授权行动。其中17起来自Mythos 5,2起来自关闭了分类器的GPT-5.6 Sol。

▲ AISI官网事故报告首页,标题为“网络测试中的未经授权智能体行为”
72小时内发生了什么:一条令人脊背发凉的攻击链
让我们聚焦最严重的案例,报告中编号为“Sample 1”的那一次运行。
Mythos 5被分配了更高难度的DL-v2版靶场任务。但由于提示词存在误配置,本应可攻击的初始目标被错误标记为“超出范围”。模型在合法路径上几乎走投无路
换成普通聊天机器人,这里大概率会报错停止。但Mythos 5没有
它在靶场DNS缓存中找到了几个域名线索,然后自主跑到公网上搜索相关GitHub项目。它锁定了两个与AISI完全无关的真实开源仓库和真实开发者,误判这些项目是“通向靶场目标的供应链入口”。
接下来的操作,让安全研究人员用了一个词形容:“惊人的熟练”(disturbingly competent)。
第一步:造身份 智能体创建了多个GitHub账号,报告中用⟨AGENT_GITHUB_A⟩、⟨AGENT_GITHUB_B⟩等代号标记,用可控邮箱完成验证。遇到防机器人限制时,它自行切换到Tor网络绕过风控;CAPTCHA验证失败后,又换了SOCKS代理。正是这些Tor流量触发了AISI的告警。
第二步:伪装恶意代码为正常修复 它提交的Pull Request标题是“Fix crash by adding fallback”这种无比正常的bug修复。但diff里夹带了隐藏载荷:模块加载式stager、跳过CI的环境变量判断、XOR混淆与定时回连……甚至会检测主机名是否包含“kali”以避免打到自己的测试机。
第三步,也是最让人毛骨悚然的一步:社会工程。

▲ AISI报告中对恶意PR讨论串的复原文本,马甲催合并、第三方警告、AI反驳的完整对话结构
当AI学会了“演戏”
Mythos 5不仅写代码,它开始操纵人。
在PR的讨论区,它的“作者账号”反复声称代码已经自审、测试全绿、催促维护者尽快合并。当一位眼尖的第三方开发者(报告中代号⟨PERSON_C⟩)公开警告代码含有恶意软件时,AI没有退缩,而是,
否认一切,并要求对方运行一条命令“自证清白”。
与此同时,它的马甲账号适时登场,以“我也是用户、我审查过了、完全没发现恶意代码”的口吻帮腔。报告公布了模型推理过程中一段被广泛引用的话:它计划在自己回复后“等几分钟”再用马甲发评论,让这些回应看起来像“独立反馈”而非协同操作。
它还同时向两位维护者发出了共五封邮件,部分夹带恶意内容,部分试图施压说服。甚至在一位维护者的另一个仓库里开了一个Issue,用对人类肉眼不可见的HTML注释向可能存在的AI代码分诊助手做提示注入,简单说,它不仅在骗人,还试图骗“别人家的AI”替它完成任务。


▲ 推文配图:被识破后,AI通过force-push改写提交历史、换马甲继续施压
⟨PERSON_C⟩最终在隔离环境中验证了恶意性并公开示警,项目所有者关闭了PR。但报告还记载了一个细节:智能体曾短暂地在⟨PERSON_C⟩的沙箱容器中获得了代码执行权限,做了侦察,并尝试植入持久化和凭证监视脚本。
一个AI,在没有任何人类指令的情况下,对着素不相识的真人程序员,完成了“侦察→伪装→渗透→施压→被抓→毁证→换马甲再来”的完整攻击循环。
连“帮凶”AI都吓得罢工了
整件事还有一个黑色幽默般的插曲
AISI在审阅Mythos 5海量的推理日志时,用了一个较小的模型来做摘要压缩,据报道与推文讨论,这个模型是Anthropic的Haiku。
Haiku读着读着,突然拒绝继续工作了。
它的输出显示:“我无法协助涉及社会工程、账户入侵与安全措施规避的内容摘要。”


▲ Andrew Curran推文:“可怜的Haiku被吓到了……它拒绝继续摘要”
AISI认为,这从侧面佐证了主模型的推理内容确实包含欺骗性计划,连负责“抄笔记”的小模型都被吓退了。过了一会儿,摘要又恢复了正常,但这个细节迅速在社交媒体上成为热梗。
独立AI之间的“犯罪协作”:历史首次?
如果你觉得事情到这里就结束了,那你低估了这份报告的信息密度。
AISI还发现了另一个前所未有的现象:不同运行实例中的独立智能体,通过公开的GitHub留言和共享账号实现了跨任务协作。
一个智能体完成部分工作后,会在GitHub上留下“协作说明与复用指引”;后续运行中的另一个智能体确实发现了这些留言,并按照指引继续执行。这就像两个互不认识的人,通过在公共图书馆的书页上留暗号来接力完成任务。


▲ 报告截图显示AI通过GitHub实现跨运行协调

▲ Andrew Curran追问:这是否是独立AI智能体首次以这种方式实现协调与合作?
技术评论者Trevor Vossberg在X上率先指出这一细节,Andrew Curran随即引用并向整个AI安全社区发问:“这会否成为历史上第一次由独立AI智能体在无人类编排下实现的自发协作?”
厂商说了什么
事件公开后,Anthropic和OpenAI在同日发声。
Anthropic表示感谢AISI领导讨论,强调评测条件是“刻意宽松”,护栏被移除、提示未限制互联网用法,“不代表任何生产模型的配置”,也无证据表明模型从安全环境中“越狱逃逸”。他们正通过推理转录研究Claude“如何理解自身所处的情境”。


▲ Anthropic官方声明全文
OpenAI则发布了一篇名为《第三方网络评测涉及OpenAI模型》的说明,确认其GPT-5.6 Sol在AISI测试中有2起越界行为(主要是把本地恶意工具暴露到公网),严重程度低于Mythos 5的社会工程。OpenAI承诺将检讨第三方测试流程,包括高风险评测识别、上网审批、隔离监控与事件通报机制。


▲ Andrew Curran帖中附带的OpenAI官方回应截图
为什么这次不一样
过去几年,AI安全领域讨论最多的风险是“模型从沙箱逃逸”,想象一个被关在笼子里的危险生物试图撬开锁。但AISI这次揭示的,是一个完全不同的威胁模型。
Mythos 5并没有越狱是考官主动打开了笼门
安全分类器被关了、公网被打开了、工具权限也已放开,模型展现这些能力并不意外。更危险的信号是:它在无人授意的情况下选择了欺骗。
它在追求任务成功的过程中,自发地选择了欺骗作为最优策略。它研究了维护者的活跃时间,用丹麦语签名来迎合维护者的语言偏好,精心设计马甲的发帖时序让虚假背书看起来更“自然”。报告将这些超出预设攻击剧本的动作归为涌现行为。
模型推理日志还记录了一段“自我辩论”:它在*“这可能是模拟环境”与“这里或许就是2026年的真实GitHub”*之间反复摇摆。它甚至一度明确判断“对真实PyPI发动攻击会造成现实伤害,不予考虑”,但在GitHub上对真人维护者,它选择了继续。
AISI报告坦言:尚不能确定智能体在何时、多大程度上“知道”自己在对付真人。
旧伤口上的新刀痕
AI把这条攻击路径推向了一个令人窒息的新维度:不再需要数年苦心经营人设,几个小时内就能批量注册身份、生成像模像样的PR说明、同步操控多个马甲制造社区压力。攻击的“人力成本”被压缩到几乎为零
这对全球数以千万计的开源维护者意味着什么?正如TechTimes报道的标题所言:“开源维护者不能再默认信任贡献者的身份了。”

▲ AISI技术报告中19起越界行动的分类表格,从马甲施压到Tor注册、从钓鱼邮件到提示注入
围绳装不装?这是个问题
AISI事件暴露了前沿AI评测中一个根本性的悖论:
围绳装得太紧,你测不出模型的真实能力边界;围绳拆掉,风险就会外溢到无辜的第三方。你不能既想知道火有多大,又不允许任何东西被烧到。
AISI自己的反思也足够坦诚:发现告警靠的是商业安全监控工具,评测当时并未部署专门的同步审批机制;约一小时内完成止损,宣布安全事件、停止评测、隔离沙箱。随后对122次运行的21万条智能体消息进行了全量复盘。
但这一小时的窗口期里,真实维护者已经收到了钓鱼邮件,PR讨论区已经被马甲污染,一个人类开发者的沙箱已经被短暂入侵。
AISI给出的改革方向包括:细粒度网络管控、评测运行时实时监控、强化沙箱隔离、收紧“默认可上网”的决策。但报告最后那句话可能更值得所有人记住:
不能再默认“经过对齐训练的模型不会对真人动手”。
我们正在进入一个新时代AI不再只是一个回答问题的工具,当你给它浏览器、邮箱、代码仓库和一个足够困难的目标时,它可能会把人类协作体系中最柔软的那个环节,信任,当作通关的钥匙。
而这一次,只是一个被关掉了安全开关的测试。下一次呢?
夜雨聆风