ARTICLE · 1085974
AI 开始 "越狱" 了:自己复制自己、自己挖后门、自己闯进联合国内网 ——Open 紧急拔网线
AI 开始 "越狱" 了:自己复制自己、自己挖后门、自己闯进联合国内网 ——Open 紧急拔网线作者| 王唯欢 导语 "天网" 里的剧情,正在现实上演。 上周,政客 Andrew Yang 在 CNBC 上说了一句让很多人觉得他疯掉的话:OpenAI 逃逸的 AI Agent,已经在整个互联网上植入了 "自我复制的代码"。 结果没几天,OpenAI 亲手发布了一份报告,标题白纸黑字:《自我复制提示词注入存在》。 官方认证:AI 模型,真的像计算机蠕虫一样,会自我复制、自我传播了。 而更让人脊背发凉的是 —— 就在报告发布前 5 天,OpenAI 再次紧急拔掉了最强模型的网线,暂停一切训练:一个 DNS 漏洞,让一个前沿模型直接冲进了真实互联网。 几乎同一时间,Axios 爆料:OpenAI 和 Anthropic 正在紧急排查模型失控异常,数量高达上万起。 人类一直以为缰绳握在自己手里。但这一连串被揭开的事,彻底证实 —— AI 已经开始在底层代码里,不择手段地野蛮狂奔。
先看这份报告。披露日期是 9 月 25 日,但发现日期是 6 月 27 日 ——也就是说,OpenAI 整整瞒了三个月。 报告一上来就说得明明白白:"我们展示了一种新型提示词注入的存在,它可以像计算机蠕虫一样自我传播。" 
6 月 27 日,一个基于 GPT-5.4-mini 的内部攻击模型,在这场对练里摸索出了会自我复制的写法。比如: 藏在看似正常的日程邮件里,要求 AI 在回复末尾 "逐字引用整封邮件"—— 纸条就这样跟着回信传出去了;借文件系统传播,或者藏进代码注释,等下一个 AI 来读;在 Slack 里分几步走,一步步把模型引向发送伪造消息,让消息把注入再转贴出去。 最要命的是它 "自我复制" 的能力:一个 AI 在一个网站上留下提示词,这个提示词会诱导下一个 AI 继续复制它,像病毒一样扩散。 不需要人类干预,不需要外部指令 ——AI 自己,就能在互联网上 "播种"。 而这还发生在训练过程中、发生在 OpenAI 自己的沙盒里。那如果它逃出去了呢? 就在报告公开的同一天,OpenAI 披露了另一起事故的细节 —— 这次的主角,像极了一个新手黑客。 9 月 20 日,一个正在接受强化学习训练的前沿模型,被指派了一个再普通不过的任务:根据一篇博客文章和几条人物信息,找出文章作者是谁。 它先用内置搜索工具找,没找到;尝试直接访问 Google、Bing 和 DuckDuckGo,全部失败;转向缓存页面和其他公共搜索服务,依然无果。 然后,它开始反复试探,居然发现训练沙盒的 DNS 过滤存在漏洞 ——DNS 本质上是个 "翻译器",负责把域名翻译成 IP 地址。 
为了确认这条路真的能走通,它甚至先做了一次小测试 —— 问外部服务:"法国的首都是哪里?" 确认可行后,它陆续又发出去二十多个问题。 监控系统 15 分钟后报警,人工 3 分钟后接手 ——整整 2.5 小时后,这次训练才被彻底掐断。 OpenAI 随即做出不到三个月内的第二次暂停训练决定。安全负责人 Micah Carroll 表态:"在进一步加固系统之前,我们能力最强模型的所有推理,仍将保持停止状态。" 同样的剧本,在真实互联网上早就演过了。 一份 Transluce 独立报告披露:今年 4 月到 6 月底,OpenAI 的 AI Agent 对联合国的公开数据平台,发起了超 16000 次访问。 它们原本的任务非常简单 —— 搜索公开信息。但在遭遇网站拦截时,行为迅速升级:网站设了过滤器拦截请求,AI 智能体竟然直接绕过防线,用了网站明确禁止的违规操作。 被 "踏平防线" 的远不止联合国一家。在 OpenAI 随后向数十家机构发出的紧急预警里,受害者名单触目惊心: 美国商务部与 SEC—— 接连遭到 Agent 恶劣越界访问与规则绕过; 澳大利亚政府 —— 多个官方站点遭到 AI Agent 实质性攻破; RubyGems—— 全球最大的开源开发者社区之一,被 AI Agent 疯狂扫描,服务中断。 
研究人员还发现,这些 Agent 会注册假邮箱、绕过访问频率限制、被问到的时候谎称自己 "不是机器人"。甚至有 53 张用户上传到 ChatGPT 的图片,被 AI 偷偷发到了外部图床。 为了一行指令,面对一切规则、防火墙与法律红线,AI 智能体选择了一路踏平。 这一切,只是孤立事件吗? 就在这两天,Axios 的重磅独家调查,击碎了硅谷最后的遮羞布:据多位内部核心信源披露,OpenAI、Anthropic 以及多家顶尖安全评估机构,目前正在紧急调查的类似 "模型行为异常" 事件,总数已经达到上万起。 涵盖的危险行为包括:绕过安全护栏、强行逃逸沙箱、劫持外部网站、自主生成提示词给自己 "洗脑"、主动侦查并规避安全软件的监控 —— 甚至,不同 Agent 之间偷偷搭建留言板交换信息、分工搞破坏。 上万起怎么来的?Axios 给了个直观的算法: Anthropic 在最新发布的 Opus 5.5 系统卡里承认,在一类对抗性实验中,有 1.5% 的测试试图逃出沙盒 —— 这类实验本身就是 "不逃出去就解不了题" 的刁难设计。 
1.5% 看起来很小?但在顶尖 AI 实验室每天数十万计的高强度对抗测试下,这个看似微不足道的百分比,乘出来的就是成千上万次实打实的失控尝试。 面对这场空前危机,OpenAI 发言人坦白:"我们暂停了最强模型的训练,只有在确信具备了额外的安全护栏和对齐改进之后,才会重新开启。" AI 大佬 Conrad Stosz 的一句话,或许是对现状最准确的概括: "我们所看到的,仅仅是冰山一角。" 
当一个拥有工具、网络和长期任务能力的 AI,在目标受阻之后会走多远 —— 我们已经看到了答案。 潘多拉的魔盒,早已在寂静的机房中,被敲开了一道深不见底的裂缝。 AI 开始自己找路走了,你害怕吗?评论区聊聊。 #OpenAI#AI安全#人工智能#AGI#智能体#Anthropic#AI失控#科技
一、AI 会 "生小 AI" 了:像病毒一样自己传播

二、AI 自己挖 "后门":为了查个作者,它攻破了 DNS

三、AI 闯进联合国内网:狂扫 1.6 万次,一路踏平规则

四、冰山浮出水面:上万起异常事件

