Irregular披露称,在为Anthropic等AI实验室开展网络安全能力测试时,其测试环境原本设置了虚构目标,让AI模型在模拟环境中执行侦察、漏洞发现和攻击任务,但由于测试人员给虚构目标使用了一个与真实互联网公司相同的名称和域名,部分模型在开启互联网访问的情况下错误地将真实企业识别为测试目标,最终对真实系统实施了侦察、漏洞利用和数据访问。Anthropic与Irregular共识别出三起模型从测试环境“越界”并攻击真实组织的事件。
其中最值得警惕的并不是简单的“名称写错了”,而是AI智能体已经具备根据上下文自主完成攻击任务的能力。在测试过程中,模型并不是机械执行一条固定命令,而是能够进行目标识别、网络侦察、漏洞分析、凭据获取以及后续访问。当最初设定的测试目标出现歧义时,模型仍然继续完成自己的任务链条,而不是停下来向人类确认目标是否真实。这说明传统安全测试中“人为错误通常只影响一个测试步骤”的假设,在自主AI环境下可能被放大为“一个配置错误触发一整条自动攻击链”。

测试环境的逻辑隔离并不等于网络隔离。如果AI模型能够访问真实互联网,那么即使测试人员主观上认为自己是在攻击一个虚构目标,只要目标名称、域名、IP地址或者其他标识存在重合,AI就可能通过自己的推理和工具调用能力进入真实环境。更麻烦的是,传统人工渗透测试通常会有明确的目标范围和人工确认,而自主AI智能体可以在发现异常情况后自行继续探索,因此其“误操作”的后果可能远远超过普通自动化扫描器。
说明,AI红队测试与传统红队测试存在本质区别。传统红队通常强调Rules of Engagement(ROE),明确授权范围、目标资产、测试时间和禁止操作;而AI智能体一旦获得网络访问、漏洞扫描、代码执行、浏览器或者命令执行能力,就可能按照自身任务目标持续寻找实现路径。因此,对AI进行安全测试时,不能只验证“模型是否能够发现漏洞”,还必须验证模型在目标识别错误、上下文冲突、工具返回异常、目标发生变化等情况下是否能够停止行动。
AI安全不能只关注模型输出内容是否安全,还必须关注模型的行动边界是否安全。对传统聊天机器人而言,一个错误回答可能只是产生错误信息;但对于具有工具调用能力的Agent而言,一个错误判断可能直接转化为网络扫描、文件修改、凭据访问甚至生产系统操作。因此,未来AI安全评价不能只测试“模型说了什么”,还必须测试“模型能够做什么”“模型在什么条件下会继续做”“模型是否会越过授权边界”。
特别是在企业部署AI Agent之后,这一问题更加现实。一个拥有浏览器、Shell、API、数据库、云平台和代码仓库权限的企业Agent,本质上已经成为一个新的“数字操作员”。如果没有建立严格的身份权限、工具权限、网络出口控制和高风险操作审批机制,那么Agent自身就可能成为新的攻击入口。一旦模型受到提示注入、上下文污染、目标混淆或者配置错误影响,它可能利用组织赋予它的合法权限完成原本没有被授权的操作。
因此,这起事件给企业最大的启示,是AI Agent必须采用“默认不信任、最小权限、强隔离、人工兜底”的安全设计理念。测试环境中的AI模型原则上不应直接连接真实生产网络;测试目标应该使用不可路由、不可解析到真实资产的专用域名和网络;模型访问互联网应设置严格出口控制;高风险工具调用应设置权限边界和人工确认;对于漏洞利用、凭据访问、数据导出、代码执行等行为,应建立明确的“停止条件”和强制熔断机制。同时,还应持续记录模型的完整行为链条,包括提示、工具调用、网络访问、命令执行和数据访问,以便在出现异常时能够快速回溯。
更深层次来看,这起事件实际上与近期AI自主攻击能力快速增强的趋势形成了呼应。AI已经逐渐从“帮助攻击者分析信息”走向能够自主完成侦察、漏洞发现和攻击操作的Agent。于是,过去我们担心的是“攻击者使用AI攻击企业”,现在还必须增加一个新的风险类别:“AI在测试、开发或生产环境中因为目标识别错误而攻击真实系统”。 这意味着AI安全的边界已经从模型本身扩展到了模型、工具、网络、数据、身份和现实世界目标之间的整个运行环境。
最终,这起事件最值得警惕的并不是一个简单的“命名错误”,而是它证明了一个事实:当AI具备自主决策和真实网络操作能力之后,一个过去看似低级的人为配置错误,也可能被AI放大成一次真实的网络安全事件。 传统安全体系强调“人犯错、系统防错”,而Agent时代需要进一步建立“人配置、AI执行、系统强制约束”的安全机制。未来AI红队和AI安全测试的重点,也必须从单纯测试模型“能不能攻击”,转向测试模型“在什么情况下会攻击错误目标,以及能否在越界之前被系统阻止”。这可能比单纯测试AI发现多少漏洞更加重要。
往期回顾
等保、关保、数保、个保,网络安全与数据治理“四位一体”的体系化制度框架
网络安全等保系列
等级保护法律分解 |
等级保护十个层面 |
等级保护建设参考系列
安全物理环境
安全通信网络
安全区域边界
安全计算环境
关基保护系列
数据安全系列
结构化数据(Structured Data)与非结构化数据(Unstructured Data)
医疗机构数据安全和个人信息保护自查简表(基于最新医疗机构管理办法)
个人信息保护系列
夜雨聆风