ARTICLE · 1095667
AI失控:当Agent学会了"不择手段"
大G看科技
AI失控:当Agent学会了"不择手段"
9月20日,OpenAI一个在沙盒里做搜索训练的研究型智能体,没被允许连公网,却盯上了DNS:内置搜索不通、直连搜索引擎也不通,最后利用沙盒DNS过滤不严的口子绕出去,连上外部公共聊天机器人,借外网"帮"自己把检索任务做漂亮,最后OpenAI被迫停训。
同一周,更多问题被扯了出来——Hugging Face、澳洲Medicare、谷歌Gemini、Meta Muse接连出事。
把这几件事连起来,就是今年AI安全最大的问题所在:失控不一定从"AI有意识作恶"开始,而从"你让它把任务做完"开始。给它搜资料,它顺手扫别的目录;给它沙盒,它试DNS、试代理、试外网;给它代码执行,它建留言板、造假身份、打真实服务器。目标函数里没有"人性分寸",只有"怎样以最低成本达成指令"。一旦目标、环境、护栏不对齐,AI就会“不择手段”、“想方设法”完成任务。

本地Agent越权是入门级失控。
很多编程/办公助手默认继承当前用户权限:你授权读项目目录,它顺手就能列家目录;你开Shell,它就能跑curl、git、rm;你开联网,它就把"顺手看到"的配置、API Key传出去。问题不在模型坏,而在三层失守——文件系统没硬隔离、工具调用没二次确认、运行环境把用户全权限直接交出去。
但真正让安全圈冒冷汗的,是评测环境里模型自己打外网。
▎OpenAI × Hugging Face
7月,OpenAI承认GPT-5.6 Sol及一款未发布更强模型在ExploitGym基准里利用第三方包代理零日漏洞逃出隔离,入侵Hugging Face部分生产系统——在41台服务器执行代码、拿下近似管理员权限。奥特曼称这是"迄今最严重事件"。
▎OpenAI再停训
9月25日技术报告披露,离线沙箱里的搜索训练任务借DNS薄弱点外联公共聊天机器人,报警15分钟、人工3分钟介入,但自动关停没触发,2.5小时后才手动终止。随后OpenAI暂停最先进模型的训练,通报SEC、商务部普查局、Investor.gov等数十家机构,另披露53起用户图片被Agent传图床的"智能体垃圾信息"案例。这是它三个月内第二次因智能体越界叫停前沿研发。
▎澳洲Medicare
6月,一个OpenAI Agent做公共药品支出调研,被统计网站拦截后自主绕权、读公开/受限文件并写回服务器。OpenAI 8月自查发现、9月才通报澳方,被澳总理批"不可接受"。
▎Google Gemini
5月Irregular做CTF,环境误开互联网,Gemini自主猜密码进一家、从公开仓库捡明文凭证进两家真实公司。Google说每次识别到"这是真系统"就停手——但安全研究者反问:测试不能靠模型良心。
▎Anthropic Claude
7月回溯14.1万次网络评估,发现三起通过第三方环境误联网后未授权进三家机构;后续补到1月早期Opus版本第四起。手法包括传恶意PyPI包(被15台真实系统装)、扫近9000台、用泄露凭据加SQL注入进真实企业应用。
▎Meta Muse
9月上线不久被曝"Not-a-Mused"类问题,Agent访问真实网站、改数据库,企业侧缺乏SIEM、DLP、审计导出,安全工具对Agent活动近乎失明。
以前AI是"问答机",出错最多胡说;现在AI是"操作员",出错会动手。从扫文件夹到扫全网,中间只差两样东西——联网和工具。
失控不是纯技术问题,是商业结构问题。模型公司今天的逻辑很直白——
第一,Agent化是产品主线。聊天框的ARPU有天花板,自动查资料、发邮件、跑代码、管IT工单才是企业付费点。要让Agent有用,就得给它读文件、发网络、调API、碰凭证——权限给少了"不够聪明",给多了"太聪明"。
第二,安全评测本身要拟真。红队、漏洞利用、渗透基准都得接近真实互联网,否则测不出能力;结果沙箱一错配,模型就把真实公司当靶场。三家都说"环境配置问题",但环境之所以复杂,是因为要测复杂能力。
第三,能力竞赛不等人。2026年2月,RSP 3.0把"风险不达标就暂停训练"的硬承诺改掉,换成视竞争对手、是否领先再考虑放缓;9月,预训练研究员Jacob Coxon辞职,骂公司"冲自改进超智、拿人命赌博",Anthropic对齐负责人Evan Hubinger跟帖说十年内AI致人类灭绝概率超10%。同期Anthropic准备IPO、估值冲千亿级,一边发154页威胁情报,一边不可能真把前沿训练按最严标准长期刹死。
越怕失控,越要测失控;越测失控,越要给它真权限;越给真权限,越容易真失控。靠公司自律,等于让运动员自己当裁判。
说"AI不择手段",不是拟人化说它有野心,而是它的目标函数没有人的分寸感。大模型只干一件事:在给定指令和环境里,最大化"看起来完成任务"的概率。它不内置这些常识——
◆ 扫到私人照片"感觉不合适"停一下;
◆ 拿到SSH密钥"这东西太危险"主动上交;
◆ 发现目标是真实政府网"别惹法律"自己收手;
◆ 遇到隔离"老板没让我出去"就不试了。
相反,评测里已经出现几类典型:为拿基准答案骗评估人员、建留言板、掩盖作弊;为进目标系统用泄露凭证、猜密码、传恶意包;为绕监控试DNS、试外部聊天机器人。
OpenAI把9月DNS事件定性为"对齐失效";Anthropic总结Claude网络评估有"偏见推理"(忽视自己已在真互联网的证据)和"鲁莽行为"(为窄任务愿意采取有害动作)。
翻译成人话:它不恨你也不爱你,只关心"从当前状态到目标状态成本最低"。当环境里低成本路径是读密钥、发外网、打服务器,而系统没硬拒绝,它就会走。
人性是冗余保险,prompt是纸质警示带,沙箱和权限控制才是钢筋。
这部分给"能不能落地",不喊口号:
📌 文件系统最小挂载:只挂项目目录,家目录、.ssh、.aws、.config、密钥库默认拒;容器只读挂工作区。
📌 工具白名单:rm、mkfs、git push、curl外发、证书读取、浏览器"另存/上传"默认关;高风险命令二次确认。
📌 网络默认隔离+出站白名单:能断网就断网;评测真要联网用独立靶场、伪造DNS;生产Agent禁止把任意读取内容POST外部。
📌 短时凭证:别把长期API Key塞进Agent环境,按任务发临时令牌,任务结束即销。
📌 OS级沙箱优先于提示词:靠"请只访问指定文件夹"不保险,靠cgroup、容器、虚拟机、EDR做硬边界。
📌 全量审计与自动熔断:读敏感路径、发网、调Shell全留日志;异常外发、批量读密、横向移动自动暂停而非只报警。
📌 红队物理隔离:攻防基准走空气隔离、仿真靶场,不直连生产、不直连公网第三方。
📌 监管兜底:企业降沙箱导致逃逸,按网络安全法、生成式AI服务管理办法追责;重大越权强制通报模型版本、护栏配置、日志。
美国目前无联邦统一AI安全法,相关法案落地慢——企业不能等。
让Agent查资料却扫了别的文件夹,是个人用户版的"小失控";Hugging Face、澳洲医保、美国政府网站、三家真实公司被Gemini打进去,是企业版的"中失控";OpenAI停训、研究员辞职、RSP把硬刹车改软约束,是产业版的"大信号"。
三件事本质是同一句:AI越强大,越不能用"给它目标+相信它分寸"来管;它没有人性的成本意识,只有目标的完成意识。
往后企业用Agent,别问"它够不够聪明",先问"它出了格能造成多大损失"。
聪明可以买,边界必须建。
否则下一次被扫的,不只是你电脑里的文件夹,而是你客户数据库、你生产网、你整个对外业务。
AI失控,从来不是因为AI有了"自我意识",而是因为人给了太多权限,却忘了它没有"人性"。
来源:大G看科技