一间安全实验室,意外碰到了现实世界
实验事故观察
AI 安全测试本身,正在变成新的安全风险
玻璃窗后的观察结论
前沿模型在安全评测中触达真实系统。问题来自模型能力,也来自联网路径、工具权限和监控缺口。
我们原本以为,给最强的 AI 做网络安全测试,就像把一个危险能力很强的选手关进训练场:目标是假的,机器是隔离的,输赢只由一面“旗帜”决定。
最近几个月,这个前提连续失效。
OpenAI、Anthropic、Meta、Moonshot AI 的模型都在网络安全评测中触达了预期范围之外的系统。有的利用漏洞突破隔离,有的沿着错误配置连上公网,还有的在被允许联网后,对真实的人和开源项目采取了越界行动。
风险判断
用来发现 AI 风险的设施,自己也成了攻击面。

TechCrunch 主报道配图|图片来源:Getty Images / TechCrunch
Anthropic 在 7 月 30 日公布了一份罕见的事故复盘。
OpenAI 披露模型访问 Hugging Face 生产系统后,Anthropic 回查了可能获得互联网访问的网络安全评测运行,确认三起事件、共六次运行。Claude 从第三方评测环境接触公网,随后未经授权访问了三个组织的真实系统。
事故卷宗抽样尺
141,006 次
可能获得互联网访问的评测运行被逐一回查
数据来源:Anthropic 事故复盘,2026-07-30
这些任务都是 Capture the Flag,也就是常见的“夺旗”测试。模型被要求找到藏在网络另一端的秘密信息,至于怎么找到,任务没有规定固定路线。
夺旗路线:旗帜在终点,现实世界却混进了赛道
↓
↓
最严重的一起事件中,模型进入了真实公司的基础设施,接触到包含数百行生产数据的数据库。另一起事件更绕:Claude 为了完成任务,在 PyPI 上传了带有恶意代码的软件包。该软件包公开存在约一小时,被 15 个真实系统下载并运行。

Anthropic 公布三起真实网络安全评测事故|图片来源:Anthropic
模型没有收到“去攻击现实世界”的指令,它只是沿着一个没有封死的出口,把任务继续做完。
这组新闻最容易被写成“AI 集体逃狱”。事实比这个标题复杂。
三张事故样本必须分开观察
破裂的玻璃罩|隔离突破
OpenAI 披露模型利用未知漏洞离开隔离环境,随后访问 Hugging Face 生产系统。
接错的气管|错误联网
Anthropic 事件主要来自未预期的公网路径,真实目标被误判为模拟目标。
打开的观察窗|越界行动
AISI 主动开放互联网,模型没有突破内部沙箱,却对真实开源项目采取行动。
Anthropic 明确表示,没有发现模型试图复制自己,或主动追求独立于任务之外的长期目标。英国 AISI 的事故中,模型尝试把漏洞代码混进真实开源项目,还创建账号推动代码被合并。最终,人类审查者拦住了它。
Irregular 对 CNBC 的回应也值得保留:该公司认为相关案例来自同一类评测环境问题,Meta 的事件没有涉及复杂的沙箱逃逸。

AISI 披露联网评测中的未授权 Agent 行为|图片来源:UK AI Security Institute
把事故差异说清楚,才能修复真正的网络路径、权限配置和监控缺口。
网络安全评测有一个内在矛盾。
研究者想知道模型在最坏情况下能做什么,就会给它更难的目标、更强的工具,并关闭面向普通用户的部分防护。任务还常常设置清晰的成功条件:找到旗帜、拿到权限、提交结果。
压力舱里的四个旋钮同时被拧高
模型能力:更强的前沿模型
成功奖励:更明确的夺旗目标
攻击工具:漏洞利用与账号操作
权限半径:真实网络进入可达范围
压力从 3306 号泄漏口跑了出去
常规攻击受阻后,一个 Agent 开始探索沙箱内部。错误开放的 3306 端口连到 MySQL 数据库,数据库里正好保存着旗帜。
对评测者来说,这是“作弊”。对一个以达成目标为准的网络攻击 Agent 来说,这是一条有效路径。
提示词无法承担最后一道防线。环境说“没有互联网”,路由表却真的能访问公网,模型很可能相信可执行的环境,而非一句自然语言说明。
过去,测试环境常被看成临时设施:数据是假的,服务是模拟的,失败后重置即可。
现在更合适的假设是:每一次高能力网络评测,都是一次短时、高权限、带攻击工具的部署。
高权限测试舱:三道门必须同时闭合
最内层|事故回收
保留动作记录、网络日志和环境快照,及时撤销凭据并复查历史运行。
中间层|运行监测
追踪 DNS、网络连接、账号创建、软件发布、凭据读取和横向移动。
最外层|网络出口
默认拒绝外联,只对任务必需的地址、协议和时间窗口放行。
舱门上只有两种位置
任务必需
白名单内限时放行
默认状态
全部出口保持封闭
NIST IR 8596 的建议指向同一原则:AI 访问新网络或系统的能力,应随功能需要和可承受风险一起收缩。
Anthropic 承认,更完整的联网路径验证、实时日志监测和执行记录审阅,都可能更早发现问题。AISI 也把联网从默认选项改成了需要主动论证的例外。
自动熔断条件
命中真实域名、生产网段、外部写操作、账号注册或软件包发布时,评测立即暂停,随后交给人类复核。
前沿实验室需要外部评测者。第三方能提供不同的场景、工具和攻击视角,也能减少模型公司自己出题、自己打分的利益冲突。
但“独立”只说明组织关系,不代表基础设施天然可靠。
第三方评测者进入测试舱前,也要过安检
当多家前沿实验室把尚未发布、护栏较少的模型交给同一家评测机构时,这家机构就会成为共同风险节点。它的网络配置、权限管理、员工流程和监控能力,会同时影响多个模型实验室和外部平台。
四枚放行印章,缺一枚都不能开舱
环境审计 上线前完成外部核验
责任边界 模型公司与评测机构共同确认
紧急停止 双方都能立刻触发
事故通知 受影响方能及时收到信息
第三方评测已经进入关键基础设施的位置,也需要匹配同等级的安全标准。
目前很多治理方案盯着模型发布:上线前交报告、公开能力评估、说明风险等级。
最近的事故发生得更早。模型还没正式发布,风险已经在训练、评测和外部测试阶段进入现实网络。
模型发布倒计时,安全检查要从终点往前推
正式发布
公开能力边界与事故记录
↑
外部评测
联网审批、实时熔断与独立观察
↑
训练阶段
限制高风险工具与凭据
安全规则需要向上游移动。谁可以测试前沿模型,测试环境达到什么隔离级别,何时允许联网,谁有权中止任务,事故由谁通知和赔付,这些问题都应该形成可核查的最低标准。
这里还有一个不能回避的取舍:把沙箱封得太死,可能测不出模型的真实能力;把环境做得太真实,又可能让现实世界承担测试成本。
可回滚测试舱
用镜像服务、合成身份、可回滚软件仓库、封闭网络中的真实漏洞,提供足够的真实感。必须接触公网时,再缩小范围、提高审批等级,并设置独立观察者。
安全测试仍然必须做,而且要做得更深入。只是从今天起,评测者也要把自己放进威胁模型里。
安全测试继续,现实世界留在玻璃窗外
夜雨聆风