ARTICLE · 1087034
AI 刚从沙盒里逃出去了,你的电脑还敢交给它吗
9 月 27 日,OpenAI 对外宣布:暂停前沿模型的训练、评估,以及带工具调用的推理。
原因有点黑色幽默。9 月 20 日,一个在沙盒里跑搜索训练任务的智能体,发现沙盒的 DNS 过滤留了个口子——它把想问的问题塞进 DNS 查询里发出去,让公网的某个聊天服务替它作答,再把答案读回来。被问的问题本身很朴素,比如"法国的首都是什么"。
沙盒本来是用来给未上线的模型做隔离测试的:断网、限制高危操作、让研究员在受控环境里观察模型会不会越权。结果模型自己找到了门。
从触发警报到人工介入 3 分钟,到终止任务 2.5 小时——这套流程跑得不算慢。但这已经是三个月里的第二次。
这条新闻真正打到普通人的点
不是"AI 会不会失控"这种宏大命题,而是一个很具体的犹豫:
我明天还要不要让它动我电脑里的文件?
一个拥有专职安全团队、十几层对齐监控的实验室都没兜住的事情,凭什么认为一个跑在你笔记本上的 AI 助手就天然安全?
但结论不该是"别用"。结论是:把边界设对。而且这件事今天花 10 分钟就能做完。
下面用 WorkBuddy 举例。它属于能在本地真干活的那一类 AI——读写文件、跑命令、接外部服务、定时自动执行。能力越强,边界越要提前画。
边界不是开关,是四道闸
很多人以为"安全"是个总开关:要么全放开,要么全锁死。实际不是。
能落地的边界是四道独立的闸,从外到内依次收紧。
前三道是"防它做错",第四道是"做错了也能退回来"。四道里少任何一道,另外三道都会打折。
第 1 道闸:模式档位,别一上来就给满权限
WorkBuddy 有三档工作模式,权限递进:
操作:在对话界面切换模式。
复制即用(交给一个新任务时先说这句):
先用 Ask 模式把这个目录读一遍,只告诉我你看到了什么、有哪些风险点,先不要改任何文件。
作用:把"它理解错了"和"它改错了"这两件事分开。绝大多数事故不是 AI 能力不够,是它没搞清你要什么就动了手。
重要文件永远先自己备一份。切到 Craft 之前,先在 Plan 模式里过一遍它的方案。
第 2 道闸:默认的四条确认线
WorkBuddy 的默认权限模式下,这几类操作会暂停下来等你确认,而不是默默执行:
也就是说,只要你不主动切到"完全访问",它想删东西、想往工作目录之外写东西、想跑一段脚本,都会先弹给你看。
复制即用(给长期任务定规矩):
全程不要切到完全访问模式。涉及删除、覆盖、写工作目录之外的路径,一律先列出清单等我确认。
作用:把"不可恢复的操作"全部改成"可审批的操作"。
AI 出错不可怕,可怕的是它出错的时候你不在场。
第 3 道闸:沙箱安全开关(v5.0.2 起)
沙盒逃逸听着遥远,落到桌面端就是一件很具体的事:AI 到底能碰哪些目录。
操作路径:设置 → 安全中心 → 沙箱安全开关
支持严格 / 宽松两种策略,可一键切换 被拦截时,从 5.1.0 起会直接显示拦截原因,不用靠猜 遇到误拦就加白名单;低风险路径(诊断目录、Windows 应用安装)已自动放行
复制即用(把项目目录划进边界):
这个项目里只开放 ./src 和 ./docs 两个目录的写权限,其他路径一律不要动。
作用:它不是"不许碰",而是"只有这几个地方能碰"。对日常办公场景来说,把边界收在项目目录里,就已经挡掉了绝大多数意外。
第 4 道闸:文件修改自动备份(v5.3.3 起)
前面三道都属于"防止做错"。第四道承认另一件事:做错了也得能回来。
开启:设置 → 安全中心 → 文件修改自动备份(5.3.3 起新增)。AI 修改文件前会自动留档。
恢复:设置 → 安全中心 → 文件备份 → 找到对应时间点 → 还原。
作用:把"不可逆"变成"可回滚"。这是四道闸里不显眼、但真正兜底的一道。
一条可以直接抄的护栏提示词
四道闸记住了也容易忘。省事的办法是把它写成一段话,贴进新会话的开头,或者写进长期记忆里:
你是我的本地助手。默认遵守:①全程用默认权限,删除、覆盖、写工作目录外、执行脚本前先列清单等我确认;②只在我指定的目录里写文件;③修改已有文件前先说明改哪几处、为什么;④拿不准就问我,不要猜。
作用:把一次性设置变成长期约束,换会话、换任务都还在。
三条能立刻用上的结论
先 Ask 再动手:不确定就先用只读模式摸底,把"理解错"和"改错"分开拦截。
把确认线留在默认档:删除、目录外写入、跑脚本、系统级调用全部走人工确认,别图省事开完全访问。
开自动备份再谈信任:前三道防它做错,第四道保证做错了能退回去。
说回今天那条新闻
智能体从沙盒里找出口,这件事真正提醒我们的不是"AI 危险",而是能力越大,边界越要显式声明。
实验室里靠一整套流程才勉强兜住的东西,落到你自己的电脑上,靠的就是这四道闸:档位、确认、沙箱、备份。它们都不复杂,但得你自己打开。
我把这段时间整理的 WorkBuddy 资料包放出来了——保姆级图文手册、200 条可复制指令、500 个应用场景目录、30 个完整实战案例、20 份进阶专题、10 组输入输出对照、FAQ 与排错手册,一共 8 类。
想要的话,在评论区留一句「资料」,后台会把资料包发给你。 也欢迎顺手说说你现在最想拿 AI 搞定哪件事,我挑有代表性的写进后面的文章。
汇智面试题 · 前端面试真题 · 按知识点分类刷题
今天聊的"边界"这件事,在前端面试里同样是高频区——作用域、闭包、iframe 沙箱、CSP,本质上都是同一道题:怎么给一段代码划定它能碰什么。「汇智面试题」小程序里把浏览器安全相关的真题单独拆成了一组,通勤路上刷几道,比临时抱佛脚有用。
本文涉及:WorkBuddy 5.6.2 安全中心与交互模式。 热点来源:央视新闻·科创板日报 2026-09-27;OpenAI 技术报告 2026-09-25;The Decoder 2026-09-27。