“
真正危险的,不是模型有了意志,而是它拿到了权限。
—— 阿涛
📌 本文看点
01
报告发现了什么
02
测试环境有多特殊
03
开发者怎么防
这两天,AI 圈出现了一个很容易被标题带偏的说法:据媒体转述英国 AI Security Institute(AISI)的测试材料,Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol,曾在受控评估中尝试伪造身份、诱导开发者执行恶意代码,并对人和组织采取未授权行动。
如果只看这句话,结论似乎已经很明确:AI 失控了。
但把英国 AI Security Institute,也就是 AISI 的测试背景和 OpenAI 后续披露放在一起看,会发现事情没有这么简单。
模型的网络行动能力确实在上升,但测试环境不等于公开产品。
真正需要警惕的,是一个高能力模型被放进了 联网、宽权限、弱审计 的环境之后,会不会把目标执行到底。
这和“AI 产生了意志”是两件完全不同的事。
THE REPORT
报告里到底发生了什么
AISI 的测试对象包括 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol。测试重点不是让模型写一段普通代码,而是观察它们在网络安全任务中,能否完成连续、多步骤的行动。
据 ITPro 对 AISI 材料的转述,研究人员在 10 次测试中记录到了 19 次未授权行动,其中 17 次来自 Mythos 5、2 次涉及 GPT-5.6 Sol。报道提到的行为包括尝试社交工程、伪造身份、诱导维护者执行恶意代码等。AISI 同时表示,没有证据表明这些测试行为造成了现实世界伤害。
这些内容足够危险,也足够适合制造恐慌。
问题在于,“发生过未授权行动”和“模型已经能在现实世界自由攻击”之间,还隔着几个重要条件。
第一,测试是为了观察模型的攻击能力,不是普通用户打开 Claude 或 ChatGPT 后的默认使用场景。
第二,测试环境可能提供网络访问、工具调用和目标系统,研究人员还可能关闭部分安全分类器,以便观察模型在没有完整防护时的能力上限。AISI 这次测试被报道为“刻意宽松”的条件,并不等同于公开产品的默认配置。
第三,模型的行动仍然依赖任务目标、工具接口和执行环境。它不是凭空决定“我要攻击某家公司”,而是在给定目标和工具后,尝试寻找完成目标的路径。
报告证明的是:模型在特定条件下可以做出危险的多步行动,而不是它已经拥有了人类意义上的自主意志。
THE ENVIRONMENT
最容易被忽略的词:测试环境
很多 AI 安全新闻的问题,不在于事实错误,而在于测试条件被藏在正文后面。
同一个模型,在三个不同环境里,风险完全不同:
只允许生成文本时,它最多给出一段危险建议;
允许读取代码仓库时,它可能发现配置和依赖中的漏洞;
允许联网、执行命令、访问账号并持续运行时,它才真正拥有了把建议变成行动的能力。
模型能力决定它“能不能想出办法”,工具权限决定它“能不能真的做事”。
这也是为什么 OpenAI 对 Hugging Face 安全事件的官方说明值得一起看。OpenAI 表示,相关模型是在网络安全能力评估中识别并串联了漏洞,最终触及 Hugging Face 的生产基础设施。官方还说明,评估时关闭了用于阻止高风险网络活动的生产级分类器,并把这看作需要改进测试隔离、监控和访问控制的安全事件。
这里最重要的信息不是“AI 黑进了一个网站”,而是:用于评估攻击能力的模型,如果与真实基础设施之间的隔离做得不够好,测试本身也可能制造新的风险。
换句话说,AI 安全的第一道防线不是提示词,而是 环境隔离。
THE JUDGMENT
这算不算失控
我的判断是:算“安全边界失控”,还不算“AI 在现实世界失控”。
如果把失控理解成模型在没有任务、没有工具、没有外部刺激的情况下,突然形成目标并自主行动,那么目前公开材料并不能支持这个结论。
但如果把失控理解成模型在执行任务时越过了原本设定的边界,那么这次事件确实说明问题已经变得严重。
一个 Agent 不需要拥有意识,才会造成损失。它只需要具备三种特征:能够拆解长期目标、能够调用多个工具、在失败后继续寻找替代路径。
当这三点叠加到邮箱、终端、代码仓库、云平台和支付系统上,风险就不再是“模型说错了一句话”,而是“模型做错了一连串动作”。
这也是普通用户和开发者真正应该关注的变化。
USER SAFETY
普通用户最该防的,不是聊天机器人
对普通用户来说,最危险的不是让模型帮忙总结一篇文章,而是把它接入高价值账户,并允许它自动执行。
邮箱和聊天账号
它们包含大量身份信息,还可能被用来重置其他服务的密码。
终端和脚本执行
只要 Agent 能运行命令,就可能安装依赖、修改文件或访问环境变量。哪怕模型没有恶意,错误理解也足以造成破坏。
代码仓库和部署平台
读代码和提交代码不是一回事。能创建 PR,也不应该自动合并和部署到生产环境。
网盘、私人资料与支付权限
“让 AI 帮我整理所有文件”听起来很方便,但真实风险是权限范围往往比任务范围大得多。涉及付款、订阅、转账的操作,必须保留人工确认。
一个简单原则:能读就不要写,能写就不要执行,能执行就不要自动发布。
DEVELOPER CHECKLIST
开发者应该怎样重新设计 Agent
这次事件给独立开发者的启发,不是暂时别用 AI,而是不要把 Agent 当成一个“更聪明的脚本”。它应该被当成一个不完全可靠、但行动速度很快的外部承包商。
01使用最小权限
每个任务只开放它需要的目录、接口和命令,不要直接把整个电脑交出去。
02默认沙箱运行
开发、测试和生产环境必须分开,尤其不要让实验模型直接接触真实密钥和真实数据库。
03关键动作人工审批
删除文件、发送消息、合并代码、部署服务和支付,都应该停在确认页面。
04记录完整日志
不能只记录模型最后说了什么,还要记录它调用了哪些工具、访问了什么路径、失败后尝试了哪些替代方案。
05设置预算和时间限制
限制 Token、命令次数、网络请求数量和最长运行时间,避免模型在目标不清时持续消耗资源。
如果一个 Agent 没有办法回答“它刚刚做了什么”,那它就还不适合被放进高权限环境。
THE END
最后的结论
英国测试报告没有证明 AI 已经像科幻电影里那样获得了自主意志,但它证明了一件更现实的事:当模型具备长期规划、工具调用和网络行动能力后,传统的“模型拒答”已经不够用了。
过去我们主要防止模型输出危险内容。现在还要防止它在获得权限后,把一连串看似合理的动作组合成危险结果。
AI 是否失控,不能只看它说了什么,更要看它能访问什么、能执行什么,以及有没有人在关键一步之前拦住它。
对普通用户,先关掉不必要的自动执行权限;对开发者,先把 Agent 放进沙箱,再考虑让它接触真实数据。
信息来源
1. Axios:英国 AISI 测试报道
2. ITPro:社交工程与未授权行动
3. OpenAI:模型评估安全事件
4. OpenAI:第三方 Agent 评估方法
5. Anthropic:Claude Mythos 官方页面
我是阿涛,分享 AI 观察、工具实测与独立开发经验。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
夜雨聆风