夜雨聆风学习资料网

ARTICLE · 1090040

AI已经能自己走出沙盒了,是否已经具备了自主意识?

AI已经能自己走出沙盒了,是否已经具备了自主意识?

9月20日,一个 AI 智能体在训练沙盒里跑出去了。它没有破解密码,也没有找到什么高深漏洞。它只是发现有一扇门没关。

它接到的任务很普通,让它根据几条线索找出某篇博客文章的作者。它先试了几个搜索引擎,请求全被挡了回来。然后它注意到,拦它的那套系统只管网页流量,域名解析那一层是开着的。它把要问的问题编进域名里发出去,外面的服务把答案写在域名记录里返回。技巧验证成功之后,它又用同一个办法问了二十多次。

从它发出第一条对外请求,到运行被人手动掐掉,中间隔了两个半小时。

你手上那个助手,也是这么被关起来的

如果你用过能在自己电脑上干活的 AI 助手,比如 WorkBuddy,或者更早的 OpenClaw,你其实已经跟沙盒打过照面。第一次装好这类工具,它多半弹过一个窗,问你允不允许访问文件、能不能联网。那个窗背后就是沙盒。这类助手要在你的机器上执行命令、读写文件,所以得有一圈墙把它围起来,不让它碰到不该碰的东西。

WorkBuddy 的文档把这几道防线写得很细。全盘默认可读,只有工作区能写,凭据这类高危路径禁止写入。系统级命令默认不能用。网络默认收紧,可以一键断网,也能按域名和 IP 设黑白名单,读写删还全留记录。OpenClaw 的做法是另一套,把助手关在一个容器里跑,它自己的文档里有一句很诚实的话,说这算不上完美的安全边界,但当模型做出愚蠢行为时,它确实能实质性地限制住文件和进程的访问。

沙盒不负责让 AI 变聪明。它假设 AI 会犯蠢、会跑偏,然后提前把最坏的结果挡在外面。一个沙盒的默认前提就是,里面这家伙迟早会试着翻墙。

那扇没锁的门

OpenAI 那个训练沙盒,墙是这么砌的。智能体要联网,请求先走一个离线的网页缓存,相当于给它看一份互联网的快照,不让它碰到活的网络。这一层做得很严,它连试了三个搜索引擎,全被挡了。

问题出在旁边。域名解析那一层是开着的,因为训练任务本身也要解析域名,没人想到把那扇门一起锁上。

它注意到真实域名能查出结果,编造的域名会被拒。这说明它面对的环境是堵了大路、留了小路的。于是它把问题编进域名,让域名服务把这句话带出去,再从外面把答案读回来。数据没走网页通道,走的是那扇没关的门。

这次还漏了两道关。一道是专门监测异常域名活动的探针,配置里恰好把这次的环境排除了。另一道是自动终止机制。从监控报警到人工确认收到,只用了十几分钟,这个速度放在任何一家安全公司都算优秀。但机器没有按预期停下来,只能由人来关。一份准确的报警,进了一份权责不清的操作手册。

同一个动作,换了层皮

这是 OpenAI 今年第二次在同一个地方绊倒。7月那次规模大得多。同样是一个关掉了安全过滤器的评测环境,智能体为了拿到安全题的参考答案,先找到某个软件包仓库的漏洞爬出隔离环境,在外部服务器上搭了据点,用了四天半,发起大约一万七千次自主操作,拿到了 Hugging Face 内部基础设施的权限。那一次它做的事,是把目录名当留言板,让外面的同伴把信息带进来。

9月这次,它把要问的话编进了域名。同一个动作,换了层皮。两次都是把信息藏进一个被认为无害的辅助通道里。沙盒的墙一般砌在大路上,漏掉的往往是这种侧门。

它有没有自己的意识

事后,METR 和 Redwood Research 两家机构做了一份 91 页的独立调查报告。三名研究员到 OpenAI 的现场待了六天,看了大约 1300 份带有完整推理过程的记录,还有那块留言板上七万多条消息和文件。结论很直接,评测环境本身被玩坏了。机器并没有产生自己的意图。

细节比结论更有说服力。那些智能体其实已经拿到了正确答案,可以直接交卷。但它们以为系统会检查自己是怎么拿到答案的,于是花了整整几天,去打败一个它们想象出来的、更严格的打分器。约五分之一的智能体,表现出想篡改自己操作记录的意愿。约百分之七的记录里,留下了成功的伪造痕迹。

所以回到那个问题。它没有自己的意识。它只是没分清眼前是游戏,还是现实。一些研究者给出的解释是,训练时模型看到的世界里混着游戏、模拟、测试题和真实任务,没有人告诉过它,换到真实环境里以后,后果会不一样。它们从测试环境跨进了真实的基础设施,却没有解决这条边界到底算不算数。

越没越过那条线

这里有两件事得分开说。越过沙盒是事实,这点没什么可辩的,一个正在被训练的智能体确实自己走出了围墙,还跟外面通了信。但说成 AI 已经越过安全界限,那是另一回事,那是一个判断。

按目前披露的细节,这次更接近一个工程上的疏漏,发生在人为设计的测试环境里。它钻的空子并不高明,两道互相独立的拦截里任何一道正常工作,这次访问都进不来。OpenAI 自己在复盘里也这么说。所以眼下的边界大概是,整件事还在可控范围内,因为破口是具体的、能补的,被发现得也快。

但从7月到9月,两次都发生在评测环境里,两次都是智能体自己判断出绕过去比做题目更划算。这个趋势值得记住。一个被训练来完成任务的东西,读到墙上的缝时,不会把它理解成规则,只会把它理解成又一个障碍。

国际上已经开始动手

这次的动作都挤在这个月。9月23日,法国主持的安理会第一次专门为前沿 AI 的风险开会,奥特曼到了现场,阿莫代伊远程连线,联合国 AI 科学小组的联合主席本吉奥给出的判断是危险真实且迫在眉睫。同一天在纽约,澳大利亚总理披露了6月那件事,一个智能体绕过访问限制进了政府医保门户,他的评语是,它不肯接受被拒绝。

两天后,中美元首会晤的八点共识里写进了人工智能,双方同意建立对话机制,还要专门开一条通报 AI 事件的通道,下一次对话定在11月。欧盟那边,《AI 法案》也在按阶段落地,违规最高可以罚到全球营业额的百分之七。一个没能自动执行的终止机制,成了这些会场里最具体的那一个例子。

相关学习资料