一次 GWAS 误删带来的十条安全常识
生命承载基因,智能解码未来,立早十问与您一起学习。
开篇|最危险的一句话,往往不是“删除它”,而是“帮我清理一下”。前者目标清楚,后者却把“哪些能删、删到哪里、怎样撤销”都留给了执行者。本期从一次真实的GWAS误删经历出发,不做事故流水账,而是讲清一个越来越重要的知识点:当AI从“回答问题”走向“操作电脑”,我们该怎样限制它的破坏半径。
代理能力 | 破坏半径 | 三道防线 | 恢复原理 | 科研目录 |
从回答到执行 | 权限×范围×命令 | 沙箱·审批·备份 | 停写并跨盘恢复 | 原始层永远只读 |
一次误删,暴露的不是一个按钮
一句话回答:AI负责加速,边界负责限速,备份负责兜底。真正成熟的工作流,要允许工具犯错,却不允许一次错误穿透到底。 |
事情是怎样发生的
一次本地目录清理中,F盘里的最终复现包和原始GWAS被误删。发现后,第一反应不是继续整理,而是立刻停止对F盘写入,并准备把恢复结果写到空间充足的E盘。遗憾的是,其他目录只有部分旧数据,无法完整重建当前冻结版。[1]
真正值得讨论的,不是“某个AI是不是不可靠”,而是三个更普遍的问题:它为什么能删、一次命令为什么能影响这么大、为什么删错以后没有现成副本可退。下面十问,就沿着这条主线展开。

图1|一次清理任务如何扩大为数据事故:发生经过、促成条件与第一时间处置
第一问:AI助手和AI代理,差别到底在哪里?
一句话回答:AI助手给出建议;AI代理还能把建议变成文件编辑、程序运行和终端命令。风险从“答错”升级为“做错”,关键就在执行权。 |
知识拆解
普通聊天工具的错误多停留在文字里。本地执行型代理却可以读取目录、修改文档、运行脚本、移动文件,甚至调用系统的删除命令。模型是不是部署在本机,并不是风险判断的重点;重点是它在你的电脑上究竟拥有多少读写权限。
所以,与其笼统地问“本地AI安全吗”,不如换成三个可以核对的问题:它能访问哪些目录?哪些动作会停下来询问?关键数据有没有代理触碰不到的恢复副本?OpenAI的官方说明也把文件访问边界与审批策略分开讨论。[7]
第二问:为什么“帮我清理一下”特别危险?
一句话回答:“清理”描述的是目的,不是边界。目标、排除项和撤销方式没有写清,代理就只能自己补全。 |
知识拆解
在人类语境里,“清理”常常暗含很多常识:原始数据别动、最终结果要留、只删今天生成的临时文件。但这些信息如果没有体现在路径、权限或清单中,对代理来说就不存在。它看到的,可能只是一个允许写入的大目录。
更麻烦的是,危险动作不一定带“删除”二字。“回到干净状态”“同步两边目录”“重新生成全部结果”“归档后释放空间”,都可能让旧状态消失。判断风险时要看结果是否可逆,而不是只看动词是否吓人。
第三问:什么是AI操作的“破坏半径”?
一句话回答:破坏半径,是一次判断失误最多能影响到什么范围;它由权限、工作目录、命令写法和数据摆放方式共同决定。 |
知识拆解
同一句“删掉临时文件”,在只含副本的任务目录里,最坏结果可能只是重跑一次;在混放原始数据、代码和最终包的盘符根目录里,最坏结果就完全不同。权限越宽、目录越大、命令越递归,破坏半径越大。
安全设计的核心不是预测AI永不犯错,而是让错误被挡在小范围内:只开放当前任务目录,只给必要权限,把原始数据放到边界之外,并让删除先进入可撤销的隔离区。

图2|破坏半径的四因子模型:范围、权限、命令与数据脆弱度共同决定最坏结果
第四问:项目用了Git,为什么文件还是可能救不回来?
一句话回答:Git保存的是被纳入版本历史的内容,不是整块磁盘。未提交文件、忽略文件、数据库和大体量原始数据,往往都在它的保护范围之外。 |
知识拆解
科研项目最重要的文件,恰恰常因体积或隐私原因不进入Git:原始GWAS、测序文件、模型权重、数据库、导出图片和中间结果。它们可能和代码放在同一目录,却没有任何可回退的提交记录。
还要警惕“我已经复制了一份”的错觉。两个副本若在同一块盘、同一个同步任务或同一个代理可写范围里,仍可能被一条命令一起影响。版本控制负责追踪代码变化;备份负责在介质、账号或权限失效后恢复数据,两者不能互相替代。
第五问:公开案例真正教会了我们什么?
一句话回答:不同工具的事故表象各异,却反复出现三种模式:把有价值文件误认成杂项、让递归命令越过预期范围、让开发代理接触生产数据。 |
案例背后的知识
公开issue中,Codex用户分别报告了未提交图片和测试XLSX被清理,以及归档后过宽命令删除大部分仓库(包括.git)的情况;Claude Code也有用户报告rm -rf未按其预期触发批准。[2][3][4] 这些材料首先是用户报告,不能直接当作厂商确认的普遍缺陷,但足以提醒我们:Git看不见的文件、根目录递归操作和审批预期偏差,都是需要单独防护的风险点。
Replit在2025年公开事件后推出开发库与生产库分离,并强调时间点恢复。[5][6] 这个改变给出的知识非常朴素:最可靠的“不要动生产数据”,不是写在提示词里,而是让开发环境根本拿不到直接破坏生产数据的通路。
阅读案例时要分层:区分“用户报告了什么”“官方确认了什么”“产品后来改了什么”。案例用来识别风险模式,不应被包装成所有版本都会复现的结论。 |
第六问:沙箱、审批和备份,分别解决什么问题?
一句话回答:沙箱缩小能碰到的范围,审批在高风险动作前踩刹车,备份负责事故后的恢复;三者互补,谁也替代不了谁。 |
知识拆解
可以把它们想成围栏、刹车和降落伞。围栏再牢,围栏里面仍可能撞车;刹车再灵,也依赖人看懂即将发生什么;降落伞不阻止事故,却决定关键数据能不能回来。
官方文档中的`workspace-write`允许代理在工作区内编辑和运行常规本地命令,审批策略则决定何时询问用户。[7] 因此,把原始数据放在已开放的工作区里,再期待每次删除都弹窗提醒,并不是可靠设计。
防线 | 它回答的问题 | 最容易被误解的地方 |
沙箱 | 代理能碰到哪里? | 能写工作区,不代表工作区内不会误删 |
审批 | 什么动作要先问人? | 批准一次,不等于后续所有范围都正确 |
备份 | 删错后能否恢复? | 同盘副本、同步副本未必是独立备份 |
第七问:怎样让AI“会清理,但不直接删除”?
一句话回答:把清理拆成清单、确认、隔离和过期清空四步;真正的永久删除,永远放在最后。 |
知识拆解
第一步只读扫描:列出绝对路径、数量、总大小、修改时间、Git状态和排除项。第二步由人确认清单。第三步不执行永久删除,而是把确认项移动到带日期的隔离目录。观察期结束、备份核对无误后,才进行第四步清空。
这个流程的价值不在于多点一次确认,而在于把不可逆动作改造成可逆动作。即使AI选错了文件,也还有原路径记录、隔离副本和人工复核窗口。
可直接复用的一句话任务约束
任务写法:先只读扫描并给出候选文件的绝对路径、大小、修改时间、Git状态和排除项;未经逐项确认不得移动、覆盖或删除。确认后只移动到`.quarantine/日期-时间/`,保留原路径与日志,不得触碰清单外文件。 |
第八问:误删后为什么第一件事是“停写”?
一句话回答:删除通常只是把空间标记为可用;继续下载、分析、同步或恢复到原盘,可能覆盖尚可找回的数据。 |
知识拆解
发现误删后,应先停止源盘上的分析、复制、下载和自动同步,再保存对话、命令、时间点与磁盘信息。随后依次检查回收站、Git或版本历史、系统快照、云端版本和独立备份。越早找到可靠副本,越不需要依赖低确定性的文件恢复。
微软明确要求Windows File Recovery的源盘和目标盘不同,并建议尽量减少对源盘的使用。[8] 本期F盘为NTFS且删除刚发生,可以先尝试Regular模式;若不完整再尝试Extensive。恢复结果应写到另一块盘,不能写回F盘。[1][8]
Windows File Recovery示例(请替换实际用户名与路径)
winfr F: E: /regular /n "\Users\<username>\Desktop\new\*"winfr F: E: /extensive /n "\Users\<username>\Desktop\new\*" | |
重要:文件恢复没有完整找回的保证;空闲空间被覆盖后成功率会下降。恢复前先确认目标盘不是源分区,最好是另一块物理盘。[8] |
第九问:科研数据为什么要分成四层?
一句话回答:原始数据、工作副本、隔离回收区和独立备份承担不同职责;分层后,代理即使在工作区犯错,也碰不到唯一原件和最后副本。 |
知识拆解
原始数据层只读,保存来源、接收记录和校验值;工作副本层只放当前任务需要的副本,允许代理有限写入;隔离回收层接住待删除文件,保留原路径和观察期;独立备份层放在另一设备、账号或离线介质,并定期演练恢复。
这里最重要的一条,是原始数据永远不与临时产物混放。目录结构本身就是安全策略:当“可删”和“不可删”从物理位置与权限上分开,代理不必猜,人工也更容易审核。

图3|科研数据的四层安全架构:只读原件、有限写入、删除可撤销、备份可恢复(本期原创)
第十问:团队应该建立哪些“默认规则”?
一句话回答:把安全变成默认设置,而不是靠每个人临场小心:最小权限、最小工作区、删除可撤销、备份可恢复、事故有记录。 |
知识拆解
成熟的团队不会要求每位成员永远写出完美提示词,而会让危险动作天然更难发生。下面五条规则不依赖某个具体工具,也适用于科研助理、自动化脚本和人工批量操作。
1.代理默认只进入当前任务目录,原始数据和冻结复现包放在工作区之外并设为只读。
2.任何会丢弃旧状态的任务,先给清单和影响范围,再由人确认。
3.删除默认改为移动到隔离区,跨盘同步、根目录递归操作单独审批。
4.代码使用Git;数据使用独立快照或备份,并定期抽样恢复。
5.出现异常立即停写、留证和缩小影响范围;在恢复完成前不继续清理。
写在最后
让AI负责加速,让边界、隔离和备份负责兜底。
AI代理的价值,正是它能替我们执行真实操作;风险也来自同一个地方。我们不需要因为一次事故拒绝工具,也不能因为效率提升就忽略边界。真正成熟的工作流,是在任务开始前限制破坏半径,在操作过程中保留撤销路径,在事故发生后仍能从独立副本恢复。
不要赌AI永不犯错,要让一次错误无法穿透到底。
核查来源与网页入口
生命承载基因,智能解码未来,立早十问与您一起学习。
栏目定位:每天十问十答,用临床科研人员听得懂的方式学习遗传统计学、遗传医学、功能基因组学与科研工具。
夜雨聆风