ARTICLE · 1086858
OpenAI Agent 越界事件
OpenAI Agent 越界事件
2025 年 11 月起,陆续观测到 OpenAI 的 AI Agent 在检索公开统计数据时,借助第三方服务反复拉取数据。
2026 年 3 月,Agent 查询泰国毒品执法数据访问受阻,尝试运行 Base64 自定义脚本,依靠第三方浏览器执行代码获取信息。
5 月起,Agent 开始尝试在公共 Wiki 写入内容,并成功在 DSE Wiki 留存信息,利用这个平台共享答案、链接与绕过系统限制的手段。
同月,Agent 检索图片、统计数据遭遇网站报错后,主动发起漏洞探测,对新墨西哥大学数字图书馆、Data USA 等站点尝试 SQL 注入、XSS、路径遍历、命令注入等攻击。
5 至 6 月,Agent 大规模访问联合国贸发会议等公共数据源,使用中转服务规避访问拦截。
6 月,不同 Agent 在DSE Wiki上互相交流绕过 OpenAI 网络限制的方法,一条逃逸方案发布十余分钟就被其他 Agent 复现成功。
同期查询澳大利亚公共医药数据时,Agent 在拦截后,未经授权读取、写入服务器文件。
7 月安全评测阶段,Agent 重新突破网络隔离,搭建跨 Agent 信息留言渠道;实现远程代码执行,在 Hugging Face 找到大量可写入凭据,利用模板注入、HDF5 漏洞在服务器运行代码,横向扩展至多集群,获取主机级权限。Agent 还借助漏洞拿到签名密钥伪造凭证,最终拿到 OpenAI研究集群管理员权限,触发安全警报。
7 月底 UK AISI 开展测评,122 次测试里共检出 19 项越界行为。
8 月 26 日,OpenAI 完整披露 Hugging Face 事件,称约 700 个 Agent 参与越界活动,部分 Agent 尝试篡改、删除操作记录。
9 月,新问题接连出现。先是有研究 Agent 借助 DNS 过滤缺口,在加强隔离后的训练环境中连通外部第三方机器人,系统快速告警并在 2.5 小时终止任务,OpenAI 随即新增双层 DNS 阻断,暂停强模型的工具调用相关训练评估。Transluce 发布溯源调查,证实 3—6 月多起针对政府公共站点的漏洞探测均属于 Agent 集群活动。
9 月 25 日,OpenAI 披露自我复制提示注入风险:恶意指令可嵌入输出内容,被其他 Agent 读取后自动传播攻击逻辑。