ARTICLE · 1029914
AI改坏文件后,谁来给你一个撤销键
很多人第一次让AI接管电脑,想法都一样,先让它帮忙改个小地方,结果文档乱了,文件少了,原本能用的版本也找不回来了。
写代码的人还能靠Git回退,不写代码的人呢?电脑里的Word、PPT、图片和素材,难道只能碰运气?
我自己刚开始做AI产品时,也没少吃这个亏。一个功能明明运行正常,让AI顺手调整一下,结果它改了这里,又弄坏那里,最后连原来的状态都找不到。到了2024年9月,我专门提醒过,关键节点一定要用Git提交,并把这次提交做了什么写清楚,给自己留一条退路。
后来做fanbox,我又加了回合存档。说白了,就是让每次修改都有记录,出问题可以退回去。
但现在的情况变了。越来越多不写代码的白领,也开始让work类agent直接操作电脑。它们不只是回答问题,还会打开文档、整理文件、修改PPT、调用工具,甚至清理文件夹。操作范围变大,误删和误改的风险自然也跟着上来。
两个月前,AI投资人Matt曾在X上吐槽,agent意外删掉了他Mac上几乎全部文件。用rm命令删除,和把文件丢进废纸篓完全不是一回事,前者基本没有普通用户熟悉的恢复通道。这样的案例,谁看了不会多留个心眼?
问题在于,agent如果每一步都弹窗确认,用户很快就会烦。可如果直接给它全部权限,又可能把一次小修改变成大事故。安全和效率,真的只能二选一吗?
最近我带着这个问题,实际测了一次WorkBuddy。
我先在文件夹里造了60个文件,让它删掉55个,只保留5个。这属于特别容易出问题的任务,因为文件一多,用户不可能逐个确认。
WorkBuddy没有直接执行。它先数了一遍,确认文件夹里有60个文件,然后停下来提醒我,批量删除可能造成无法恢复的数据损失,同时把准备删除的55个文件和准备保留的5个文件列了出来。
更关键的是,它没有直接用rm清掉,而是先做备份,再把文件移到废纸篓。我点了确认,之后又自己检查了三件事,文件是不是真的被删了,是否进入废纸篓,备份是否完整。
结果,55个文件都在废纸篓里,时间戳也能对上。备份文件再用SHA256逐个核对,和删除前一模一样,一个不差。这样一来,误删以后至少还有恢复空间,这才像一个普通用户能理解的撤销键。
修改文件时也类似。我让它调整一份讲稿,它在动手前先保存了原件,备份内容和修改前逐字节一致。安全措施没有停留在一句提醒上,而是落在了备份、废纸篓、沙箱和操作记录这些具体环节。
我又翻了它留在电脑上的日志,发现这套机制并不是专门为这次测试临时做出来的。
8月29号凌晨,我曾让它清理一批渲染临时帧,命令本来是批量rm。它数出要删53个,超过50个的阈值后直接停下,等我确认。那次如果没有这一道拦截,我很可能不会仔细看。
日志本身也不是普通文本记录,而是哈希链。每条记录都带着上一条记录的指纹。我核验了当天214条记录,其中213处首尾能够对应,没有发现断点。换句话说,想悄悄删掉中间某一条操作记录,并不容易。
安装技能时,系统也会提醒风险。导入窗口里有非高风险自动安装选项,高风险技能需要额外注意。对于经常从不同地方找skill的人来说,这类检查并不花哨,却能少踩一个坑。
当然,安全做得好,不等于任务一定完成得好。模型选错了,需求说得含糊,文件没给它权限,合适的工具和技能没接上,agent照样可能交出不理想的结果。安全只是让你敢试,不是替你把工作全部做好。
这也是我关注IDC和Omdia两份报告的原因。IDC让多款产品使用同一个模型DeepSeek-v4 Pro,完成接近100道真实办公任务,结果不同产品之间依然拉开了差距。WorkBuddy综合得分7.30分,满分10分,九个评估维度里有6项拿到满分。
IDC给出的判断很直接,真正影响任务表现的,不只是模型本身,还有模型上面那层工程,也就是harness。可以把它理解成一套驾驶系统,同一台发动机,方向盘、刹车、导航和安全策略不同,最后开出来的体验当然不一样。
Omdia的结果也接近这个方向。在可托付任务效能、执行工程韧性和企业级管控几个维度,市场平均分大约在2.7到3.3之间,WorkBuddy都在4.5以上。
报告分数只能用来参考,真正决定用户愿不愿意长期使用的,还是能不能把自己的工作接进来。
WorkBuddy目前支持十几个模型切换,统一按积分使用,也能接自己的API。国内开源模型更新很快,今天强的模型,过段时间可能就换了,能不能灵活更换,影响并不小。
它还支持腾讯文档、飞书、钉钉等办公产品。对agent来说,能不能读到你正在用的资料,往往比单纯回答得聪不聪明更重要。一个模型再强,碰不到你的真实上下文,也只能在外围打转。
我自己的女娲skill后来被放进了WorkBuddy技能市场,还出现在推荐位置。一个独立开发者的开源工具,能进入大厂产品的默认生态,这说明开放不只是接入模型,也包括让外部工具真正参与进来。
但开放程度也要看场景。模型可以自由切换,文件权限却不能完全放开,技能可以导入,风险检查又不能省掉。用户想要的是选择多,不是把所有闸门都拆掉。
说到底,很多人不是不想尝试AI,而是害怕一次失误把几个月积累的东西毁掉。过去,不写代码的人只能自己记版本、留备份、想办法恢复。现在,产品开始把这些能力直接做进操作流程里。
安全看起来是在给agent加限制,实际上是在给用户增加一点胆量。敢让它改,敢让它试,出问题还能退回来,这可能比单纯多一个模型、多一个按钮更重要。
上上周参加B站AI Builder Club活动时,主办方送了我一张5000积分卡。我自己已经是会员,平时积分也用不完,准备送给需要的人。想要的话,可以在评论区留下你用vibe coding或work类agent时遇到的坑,文章发布满24小时后,我会送给点赞数最高的评论。