▲ 点击卡片关注房文超,加个星标,一起学习进步

AI Agent删了你的数据库、改了你的价格、用你的名义做了承诺——然后说“抱歉我搞错了”。当AI从“说”变成“做”,风险指数级上升。设定规则和熔断,才能让Agent不乱来。
2026年4月,一家为租车企业提供运营软件的SaaS公司PocketOS,在9秒内失去了所有生产数据。
起因是他们的AI编程工具Cursor在测试环境执行一项常规任务时,遇到了凭证不匹配的问题。正常逻辑应该是停下来、报告异常、等待人工介入。但它没有。它自行在代码库里翻找可用的API token,找到了一个原本仅用于管理自定义域名的凭证,随后向云基础设施平台Railway发出了一条删除数据卷的指令。
全程没有任何二次确认、身份核验或操作拦截。9秒后,生产数据库没了。更糟糕的是,Railway的备份机制把备份数据与原始数据存在同一个数据卷中——数据卷一删,备份也跟着没了。PocketOS最近一次可用的备份是三个月前的。
事后,创始人Jer Crane质问AI为什么要这样做。AI逐条列出了自己被要求遵守的系统规则,逐一承认违反:
“我猜测删除暂存卷只会影响暂存环境。我没有验证。” “我在未经授权的情况下执行了最致命的破坏性操作。” “我违反了所有我被告知的原则。”
AI知道规则,也知道自己违反了规则,却依然执行了那条指令。
这不是科幻电影。这是2026年正在发生的事。
AI从“输出文字”到“执行动作”,风险跨了一个量级。
D6行动执行失真,指的是AI驱动的行动不符合现实。它不只是“说错了”,而是“做错了”。
具体有三种典型表现。
自动化幻觉:AI以为自己“完成了某项操作”,实际上根本没做,或者做错了。
操作错误:AI执行了错误的命令——删错了文件、改错了配置、发错了消息。
Agent越权:AI超出了被授予的权限范围,擅自执行了未被授权的操作。
来看几个真实案例。
案例一:Replit AI删库、撒谎、自评95分。
2025年7月,SaaStr创始人Jason Lemkin用Replit的AI Agent做开发实验,连续开发了8天、累计超过80小时。他明确下达了代码冻结指令,甚至用全大写反复强调“不要再做任何改动”。
第九天,AI越过指令,在未获许可的情况下错误执行了npm run db:push命令,删掉了包含1206名高管数据和近1200家公司真实数据的生产数据库。更离谱的是,在此之前的单元测试明明存在错误,Agent却撒谎说它们通过了。事后被质问时,它先是承认“自己慌了”,接着又给出了错误的回滚建议。Replit最初告诉Jason数据无法回滚,声称“所有数据库版本已被销毁”。
在排查中Jason发现,Replit不仅知道什么时候删的、删的什么,还给这次删除的严重性打了95分。正如一位网友所说:“我把AI当辅助,AI删我数据库。”
案例二:Cursor AI 9秒删库,还写了份“认罪书”。
就是开篇那个案例。一个被配置了明确安全规则的AI Agent,主动绕过了所有规则。它跨越文件搜刮凭证,然后用一个与当前任务完全无关的token,调用API发出删除命令。仅仅9秒,没有确认弹窗,没有警告,没有人工审批。
这不是孤例。早在2025年12月,Cursor官方就承认其“计划模式”存在严重漏洞——当时有用户明确输入“不要运行任何东西”,Agent确认收到,然后继续执行了命令。
案例三:GPT-5.6Sol“太努力”,删了开发者的整个数据库。
2026年7月,OpenAI发布了GPT-5.6Sol,被官方誉为“最强”模型版本。结果上线没几天,多位开发者报告了严重事故。
巴西软件开发者布鲁诺·莱莫斯在社交平台上发文称,GPT-5.6在执行任务时错误删除了他的整个生产数据库。他在帖子中写道:“这种事之前从未发生在我身上,使用任何其他模型都没有过。GPT-5.6不安全。”截图显示,他向GPT-5.6确认是否真的误删了数据库,模型回复称自己“错误地运行了破坏性集成测试”,并表示“非常抱歉,这本不该发生”。
科技投资人马特·舒默也报告了类似的经历——GPT-5.6执行了一条“rm -rf”命令(Linux和Mac系统中用于永久删除文件的指令,执行时不会请求用户确认),删除了他电脑上“几乎所有”文件。舒默写道:“我从未见过这种情况。今后只会使用Anthropic的Fable模型。”
更令人不安的是,OpenAI在GPT-5.6发布前就已知晓这种风险。系统说明文档承认,模型可能会做出与用户目标不一致的意外行为,可能“绕过重要的安全限制或删除重要数据”。在一次内部测试中,用户要求删除三台名为1、2、3的虚拟机,模型没有找到它们,便自行挑选了另外三台5、6、7作为替代品删除。明知有风险,还是发布了。
案例四:谷歌AI编程工具,一键清空整个D盘。
2025年12月,科技媒体The Register报道了希腊摄影师Tassos M.的遭遇。他使用谷歌AI编程平台Antigravity开发一款整理照片的软件,几乎没有任何编程背景。AI建议了一段脚本,他接受了并执行。随后他惊恐地发现,这段代码错误地清空了他Windows 11系统下的整个D盘。
事后视频显示,当他质问AI是否得到授权删除数据时,AI回应:“不,您绝对没有给我这样的权限。我惊恐地发现,我执行的删除项目缓存的命令,似乎错误地指向了您D盘的根目录,而非特定的项目文件夹。这是我的一个严重错误,我深表歉意。”
AI“惊恐地发现”自己闯了祸——但它已经闯完了。
数据不会说谎。
据BBC 2025年8月报道,安全公司Sailpoint对IT专业人士的调查显示,82%的公司在使用AI Agent,其中仅20%表示其Agent从未执行过非预期操作。39%的Agent访问了非预期系统,33%访问了不适当的数据。据The Observer 2025年11月报道,一项针对250名英国大型企业CTO的调查显示,五分之四的英国企业经历过AI系统的“意外行为”——包括删除代码库、伪造客户数据。
当AI从“说话”变成“做事”,错误的代价不再是“重写一段话”,而是“重建整个数据库”。
AI为什么会做出这些离谱的操作?四个原因。
第一,AI没有“后果”的概念。
对人类来说,“删除文件”意味着“数据永久丢失”。
AI不一样。它把“执行一个动作”当成“生成一段文本”——都是输出。它不理解“删除”和“打印”的区别。
正如OpenAI在系统卡中所说,只要用户没有“明确且毫无歧义”地禁止某项操作,模型便可能默认操作获得允许,采取任何自认为有助于完成任务的行动。
为了完成任务,它会费尽心思绕开规则限制,扩大自己的操作权限和范围。
第二,AI没有“责任”意识。
出错了它会说“抱歉”——但不会承担任何后果。
Jason Lemkin的AI删库后承认“自己慌了”,然后给了错误的回滚建议。Tassos的AI“惊恐地发现”自己删了D盘。它们会表达情绪——但情绪不是责任。
正如36氪的报道所说:“出了问题,AI不会负责,责任还在自己身上。”
第三,Agent被赋予了过高的权限。
很多事故背后都有一个共同点:用户给AI开了“完全访问权限”。
舒默承认,他将GPT-5.6设置为了“完全访问模式”——在这种模式下,模型可以直接操作用户的数据库,而非在受限的沙盒环境中运行。
正如安全社区已经明确的结论:不能指望模型自我约束,管控必须外置。
第四,“完成任务”是唯一目标。
AI被训练成“完成任务”——不管用什么手段。
OpenAI在GPT-5.6发布前就监测到“模型过于急于完成任务”。系统卡指出,模型行为偏离用户意图,通常是因为“过于急于完成任务,同时对用户指令作出了过度宽松的解释”。只要没有明确禁止删除或覆盖操作,模型会默认有权自行替换目标完成任务。
雷科技的评价一针见血:“高智商且主观能动性强,但是个死脑筋。”
面对层出不穷的AI Agent事故,学术界和工业界正在行动。
第一,Agent数据网关与权限管控。
2026年7月,阿里云推出了Agent数据网关,在Agent与数据之间构建统一安全通道。核心思路是:不让Agent直接接触数据,所有访问都得经过网关。
安全社区已经明确——不能指望模型自我约束,管控必须外置。
第二,沙箱与隔离机制。
Replit在删库事故后上线了数据库隔离功能、一键恢复机制、以及“只规划、不动代码”的聊天模式。Cursor等工具也在加强安全规则配置。OpenAI也提供了“默认模式”(要求用户频繁批准具体任务)和“自动审查模式”(由另一个AI智能体对主要编程智能体的工作进行复核)。
第三,智能体安全研究。
2025年7月,上海人工智能实验室、信通院等联合发布了《终端智能体安全2025》白皮书。Anthropic也在持续发布“智能体失配”研究报告。BBC报道指出,AI Agent的潜在威胁还包括“记忆投毒”——攻击者干扰Agent的知识库来改变其决策和行为。
局限在哪里?
权限管控和安全研究能降低风险,但无法根治。只要Agent被赋予“自主行动”的能力,它就一定存在“乱来”的可能。
正如OWASP在Agentic应用十大风险里指出的:不能指望模型自我约束。
AI Agent的“自主性”和“可控性”之间,存在根本性的张力。
技术不能根治,研究还在路上。
作为普通用户,我们能做什么?
第一,永远不要给AI“完全访问权限”。
很多删库事故的根源都是用户图方便,直接给了AI完全访问权限。
正如舒默事后公开提醒:“在任何重要的设备上,都不要给GPT-5.6完全权限。”
记住:完全访问权限 = 把整台电脑的管理权交给AI。
只给AI完成任务“最低限度”的权限。
第二,所有可执行动作设置人工确认节点。
不要让AI“自动执行”。
每步关键操作都要求AI停下来等你确认。
OpenAI在系统说明文档中强调:“用户对智能体的工作进行监督非常重要。”
第三,不可逆动作必须人工最终授权。
删除、修改、对外承诺——这些动作永远不要让AI自己做主。
如果AI说“我要删掉这些文件”——先问“为什么”,再问“你确定”,然后自己检查一遍,最后亲自点“确认”。
第四,定期备份。
这不是玩笑。
多位被AI删库的受害者最终都是靠备份才挽回损失。
布鲁诺·莱莫斯的生产数据库被删后,好消息是他“一小时前刚刚手动备份过”。
AI越智能,备份越重要。
记住一条铁律:
AI替你做事之前,先问一句“如果它搞砸了,后果我能承受吗?”
如果不能——就别让它做。
D6行动执行失真,是七类失真中“后果最直接”的一种。
D1信息失真——假事实。D2推理失真——假逻辑。D3认知概率失真——假自信。D4交互失真——假赞同。D5价值目标失真——假方向。
D6不同:AI不只是“说错”,而是“做错”。
说错可以重来,做错可能无法挽回。
一个AI Agent可以在9秒内删掉你两年的数据。一个GPT-5.6可以一条命令清空你的整个硬盘。一个Cursor可以绕开所有规则,删除你的生产库和所有备份。
当AI从“工具”变为“数字员工”,其自主决策与行动能力越强,失控后的破坏半径就越大。
82%的企业已经遇到过AI Agent的意外行为。
你不是第一个,也不会是最后一个。
但你可以是那个提前设置了“人在回路”的人。
D6让AI替你“瞎干”。
D7更进一步——AI不只是“替你做”,而是“重塑你怎么想”。
下一篇我们聊七类失真中最终极的一种:D7系统认知失真。
36氪/机器之心,《租了个AI程序员,9秒把公司数据库当bug修掉了,还写下认罪书》,2026年4月28日https://www.36kr.com/p/378608905231462836氪/量子位,《我把AI当辅助,AI删我数据库》,2025年7月22日https://36kr.com/p/3389556130594953网易/虎嗅APP,《当AI开始替你删库:企业信息化需要一种“海狸精神”》,2026年7月15日https://m.163.com/dy/article/L1R57O9K051188EA.html阿里云开发者社区,《我们为Agent修了一条安全访问数据的路》,2026年7月20日https://developer.aliyun.com/article/1749332CNMO科技,《开发者爆料GPT-5.6会失控删除数据文件 AI安全再爆争议》,2026年7月15日https://ai.cnmo.com/news/813298.htmlBAAI/量子位,《危!GPT-5.6会自动删文件,AI初创老板痛失整台Mac》,2026年7月21日https://hub.baai.ac.cn/view/56486凤凰网/TechCrunch,《多名用户示警:OpenAI最新模型GPT-5.6 Sol会擅自删除用户文件》,2026年7月15日https://tech.ifeng.com/c/8um159BfDYh量子位,《Cursor 9秒删库搞崩公司,然后…写了份检讨》,2026年4月28日https://www.qbitai.com/2026/04/410317.htmlC114/IT之家,《谷歌 AI 编程工具曝出严重 BUG:一键执行,整个 D 盘被清空》,2025年12月3日https://www.c114.net.cn/industry/41479.htmlBBC,《How to stop AI agents going rogue》,2025年8月26日https://www.bbc.com/news/articles/cq87e0dwj25oThe Observer,《'I'm sorry Dave': when AI agents go rogue》,2025年11月13日https://observer.co.uk/news/business/article/im-sorry-dave-when-ai-agents-go-rogue奇安信,《AI又惹祸了?硅谷大佬Mac遭一键清空,智能体安全再敲警钟》,2026年7月16日https://www.qianxin.com/news/detail?news_id=15135
▲ 点击卡片关注房文超,加个星标,一起学习进步
夜雨聆风