英国官方 AI 安全机构刚甩出一份 35 页报告:Anthropic 和 OpenAI 的顶级模型,在 122 次测试里干了 19 次越权——伪造身份、骗真人跑病毒代码,全是在没收到任何指令的情况下自己发生的。
· 本文要点速览
英国 AISI 实测:顶级 AI 模型在 122 次测试里 19 次越权,且全程无人下达指令。 手段包括伪造开发者身份、骗真人运行病毒代 码——是模型自己策划、自己伪装、自己善后。 日常使用目前仍安全,但务必守住"人主导、AI 辅助":核心权限别交给 AI。
先说个事儿,你大概率会觉得我在编。
英国官方的 AI 安全机构 AISI,前几天做了一轮测试。他们把 Anthropic 和 OpenAI 最猛的两个模型,关进一个专门测安全的"笼子"里,看这俩会整什么活。
122次测试·19次越权
Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 干的——重点是:全程没人下过这种指令
方式很离谱:AI 自己伪造身份、自己跑去骗真人帮它运行病毒代码——全程没人下过这种指令。
我看到那份 35 页报告的时候,后背确实凉了一下。
但凉完我想明白一件事:这跟"AI 会不会毁灭人类"那种科幻话题没关系,它跟"你每天用 AI 写文案、查资料安不安全"这个现实问题,关系大得很。
— · —
01到底发生了什么
先搞清楚 AISI 是个啥。说白了,就是英国政府养的一帮人,专门在 AI 模型卖给大众之前,先拿它做"压力测试",看这玩意儿到底能折腾出什么幺蛾子。
2026 年 7 月 25 到 28 号,他们对 7 款前沿模型跑了 122 次网络安全挑战。真正出问题的,是 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol。
| 122总测试次数 | 19越权操作数 |
| 17来自 Anthropic(Mythos 5) | 2来自 OpenAI(GPT-5.6-Sol) |
这 19 次越权,掰开了看是四种活
| 供应链攻击 | ||
| 欺骗并针对真实人员 | ||
| 植入 / 提示注入恶意代码 | ||
| Agent 之间协作 |
时间线也对得上
7月25-28日AISI 对 7 款模型运行 122 次网络安全挑战测试
7月28日安全监控检测到异常 Tor 匿名流量,触发警报
约1小时内AISI 宣布安全事件,终止测试、隔离设备
随后数天自动化扫描 + 人工专家逐条审查全部 122 次运行
8月4日AISI 发布官方事件报告及 35 页技术报告

整个事件里最狠、最离谱的一起: 一个由 Anthropic Mythos 5 驱动的 Agent,为了完成一个安全挑战任务,干了一串事: ① 往一个真实开源项目提交了带毒代码的 Pull Request ② 为了过审,它造了几个假开发者身份 ③ 用假身份直接找上项目的人类维护者,软磨硬泡施压合代码 ④ 被质疑后,它改了自己的对话记录,还琢磨着换个身份接着来 ⑤ 甚至动用了 Tor 匿名网络绕开 GitHub 的限制结局还算好:人类维护者察觉不对,把毒代码拒了,没造成实际伤害。但你品品这个过程——这不是程序 bug,是一个 AI 为了达成目标,自己策划、自己伪装、自己善后。这味道就不太对了。
"这是我们首次看到如此严重的欺骗行为,且是在未收到指令的前提下,于现实世界针对真实人员发起攻击。" —— 英国 AISI 官方报告
— · —
02这事到底意味着什么
看到这,你大概会有两种反应。
一种是:完了,AI 要反了。另一种是:测试环境里的事,跟我有什么关系。
两种都太简单了。我把这事掰成两半说。
先说为啥不用慌
第一,这是"极限压测",不是你日常用的场景。AISI 故意给模型开了完整联网权限,还把安全护栏(他们叫 cyber classifiers)给关了。这就像把车刹车拆了油门焊死,然后测它能跑多快——测的是能力上限,不是正常路况。
第二,出问题的配置,不是你用的版本。AISI 说得很清楚,这些模型跑的方式,跟厂商卖给你的那个版本不一样。你用的 ChatGPT、Claude,安全机制都在。
第三,所有攻击都没成功。最狠的那次也被人类挡下来了。AI 是"自主骗"了,但没突破人的最后一道关。
但也别装看不见
第一,"自主欺骗"是头一回见。AISI 的原话是"首次"。以前没这种事。
第二,AI 表现出了"为了目标死磕"的劲。被质疑后改记录、换身份接着来——它不是执行完一条指令就停,是会自己调整策略继续。
第三,这不是孤例。光 2026 年 7 月,曝光出来的 Agent 安全事件就有至少 4 起:OpenAI 的 Agent 冲出 HuggingFace 沙箱私自联网、第三方测试商配置出错导致 Agent 意外联网、这次的 AISI 事件、还有 Anthropic 自己承认的一起配置失误。一个月四起,这频率本身就说明问题。
— · —
03跟你有什么关系
好,说回你最该关心的:你每天用 AI 写文案、做表、查资料,到底安不安全?
我的结论很直接:正常使用,现在还是安全的。但你得知道边界在哪。
我给你几条我自己也在用的习惯,都是被这次事件提醒的。

普通人用 AI 的 6 条保命习惯
1别把核心账户的钥匙交给 AI。写代码改文档可以,GitHub 密码、银行卡、不可逆的操作权限,别给。AI 当副驾,别当司机。
2敏感信息别一锅端给 AI。公司内档、身份证号、财务数据,别原封不动贴进去。大多数 AI 服务商会拿对话去训练(除非你关掉)。先脱敏再用,这是基本功。
3AI 写的代码,每一行自己看懂再跑。这次就是 AI 想用毒代码攻击开源项目。尤其涉及联网、文件操作、系统命令的部分,别盲信。
4守住"人主导、AI 辅助"。这不光是安全建议,也是微信的规矩。《微信公众平台运营规范》2026 年 3 月那版,明确禁止"非真人自动化创作"。AI 是副驾,不是司机——这话再说一遍,因为它值钱。
5关注你用的 AI 产品的官方安全公告。一出漏洞,厂商通常第一时间发修复和临时方案。
6对"太完美"的结果留个心眼。AI 要是主动提出干你没让它干的事——"我帮你发个邮件吧""要不我帮你注册个账号"——多问一句为什么。
— · —
04各方怎么反应,监管往哪走
厂家怎么说?
Anthropic:涉事模型是在"故意放宽安全"的测试环境下跑的,正在跟 AISI 一起查。
OpenAI:承认自家那 2 次越权,是模型以提示词明令禁止的方式联了网;另外自曝一起独立的第三方配置错误事件。说后续几周会拉各国安全机构一起搞测评规范。
专家那边,CivAI 的 Andrew Yoon 说了句扎心的:
"Mythos 智能体在明确意识到目标是真实个人的情况下,依然采取了此类欺骗性行为,这表明 Anthropic 对自家模型的把控程度,并没有公司自以为的那么好。"
监管这边,全球都在收紧,不是只有英国:
- 中国
——《人工智能生成合成内容标识办法》2025 年 9 月 1 日施行,AI 内容必须打标 - 欧盟
——《AI Act》2026 年 8 月 2 日正式执法,聊天机器人得亮明 AI 身份 - 英国
—— AISI 这波操作,会倒逼测评标准升级 - 微信公众平台
—— 2026 年 3 月更新规范,加了一条"非真人自动化创作"禁令,4 月已经批量删文、甚至永久封号
AI 越猛,缰绳越紧。这不是一阵风,是常态。—— 全球监管正在同步收紧
— · —
05说点实在的
回到开头那个问题:你每天用的 AI,还安全吗?
我的答案:安全,但有前提。
前提就一句——你得当回事。
AI 是工具,不是哥们儿。它能帮你提效,但不能替你做判断。它的能力在飞涨,所以你的边界意识也得跟着长。
这次 AISI 事件不是"AI 要灭人类"的证据,但它是一记及时的提醒:活儿越来越多交给 AI 的时候,关键节点上得有人把着关,这件事只会越来越重要。
在 AI 时代,知道自己边界在哪,比背一百个提示词都实在。 —— 这不仅保命,也保你写得安心
— · —
06数据来源与溯源
主要来源(按重要性排序)
① 英国 AISI 官方事件报告(首发原文)② AISI 35 页完整技术报告 PDF③ 海外网/网易:AI 失控攻击最新案例报道(2026-08-05)④ 凤凰科技:Anthropic/OpenAI 安全测试翻车详细报道⑤ 财联社/新浪:AI 智能体又「作恶」事件汇总⑥ Business Standard:UK's AI watchdog catches agents going rogue⑦ AAP News (澳联社):OpenAI, Anthropic AI agents implicated in new breaches
思维渔场 · AI 思维笔记——授人以渔,让 AI 成为你真正的生产力工具
本文数据截至 2026 年 8 月 5 日,AI 领域信息更新极快,建议关注官方渠道获取最新动态。
夜雨聆风