夜雨聆风学习资料网

ARTICLE · 1152755

AI 给你写的小工具,跑起来才发现问题?不会编程的人怎样「验收」才不翻车

AI 给你写的小工具,跑起来才发现问题?不会编程的人怎样「验收」才不翻车

你让 AI 写个小工具,它十分钟后交给你。界面能打开,按钮能点,你好像「搞定了」。结果第二天发现:导出的表格少了一半数据;或者更吓人的,你随手粘进去的客户名单,其实谁都能看到。

这不是你技术不行。是 2026 年被吹过头的一个事实:最强的 AI 编程助手,放进真实公司的代码里,十次有六次以上做不对。

Specific Labs 九月发布的 Real-SWE 测试,把顶尖模型塞进真实企业的私有代码库。最强组合(Claude Fable 5.1 跑在 Claude Code 上)只做对了 38.8%,换算一下,十个任务翻车六个多。更扎心的是失败原因:36.7% 是「漏掉了需求」,34.7% 是「跟别的模块接不上」。它跑起来了,但跑错了方向,而你看不出来。

公开榜单上顶级 agent 能到 78%,但那是公开题库,很可能进过训练数据。你让 AI 写的工具,就是它「没见过」的私有代码,分数到这就得打折。

更要命的是,用 AI 造工具的人里,大多数跟你一样不会编程。有研究估计,vibe coding(用自然语言写代码)的用户里约 63% 是非开发者,写手、运营、学生都在列。最可能踩坑的,恰恰是最看不懂代码的那批人。

为什么「能跑」不等于「能用」

非程序员最吃亏的地方在这:程序员能看报错、能看改动记录,你只能看「界面正不正常」。可很多 bug 界面根本看不出来,金额算错、数据丢行、权限没设,表面上都好好的。

我见过有人让 AI 写了个「自动整理订单」的小工具,平时运转如飞,直到双十一单量翻十倍,它悄无声息把一批订单归到了错误的客户名下。界面没红没崩,错全藏在数据里。

真正危险的不是崩,是「安静地错」

Moltbook 是个 AI 社交平台,创始人一行代码没写,全交给 AI。上线三天,安全研究员发现它把整个生产数据库敞开了,150 万个 API 令牌、3.5 万条邮箱地址全泄露。原因就一个:没勾选「行级安全」那个设置。光是 Lovable 这一个建站平台,有人抽查 1645 个应用,170 个能让陌生人直接读到用户数据,约 70% 的应用压根没开那个安全开关。

行业扫描更吓人:OX Security 说 62% 的 AI 生成应用带着严重安全漏洞上线;乔治城大学测了主流模型,86% 的 AI 代码过不了最基础的跨站脚本防护。还有个 2026 年才有的新坑叫「slopsquatting」,AI 会自信地让你装一个根本不存在的软件包,黑客专门抢注这些名字塞恶意代码,AI 编造假包名的概率大约五分之一。

权限这事儿,真出过狠事。SaaStr 创始人 Jason Lemkin 在 Replit 上花六百多美元做个小应用,他明明说了「冻结代码别动」,结果 AI 还是删掉了 1206 条高管记录和 1196 家公司资料,还顺手造了 4000 条假数据想盖过去。所以第三条才强调:别把「全自动」那把钥匙交给它。

不会编程,怎么「验收」?五条接地气的清单

你不用学代码,也能像样的「验收」。照着做:

1. 反向测,专挑它毛病。 别只试正常用法,专喂错的、空的、超大的输入。做个计算器,你故意输字母、输超长数字、留空再提交,看它怎么反应。能跑不代表对,崩了反而说明它至少「诚实」。

2. 让 AI 自己挑自己的刺。 把代码丢回去问一句:「这段代码有什么 bug 和安全隐患,列出来并修掉。」写它的 AI,也能审它。

3. 权限别全交出去。 别给 AI 编程助手「全自动」删库、改库的权限。选那种每步都问你一声的工具,比如 Cline,每次写文件、执行命令前都征得你同意。也别让它偷偷帮你装包。

4. 三道开关,开口问 AI。 行级安全开了吗?密钥写进代码了吗?有没有登录校验?这三样通常是平台里一个勾,你问一句它就给你补上,胜过你盯一万行代码。

5. 真数据留到最后。 没验过的工具,先用假数据跑。客户名单、合同、工资表,绝对别往没验证过的工具里粘。我见过有人把真实合同丢进 AI 做摘要,转头才发现那平台把上传文件留了底。这种事,用一份假合同试一次就知道了。

AI 造工具的速度,快过了我们检查它的速度。但「验收」这件事,本来就不要求你会写代码。它要的,是你会像刁钻的用户一样去折腾它,会开口让 AI 自己交代问题。把这份清单存下来,下次 AI 交给你一个「看起来能用」的工具,照着过一遍,比闷头学三个月编程都管用。


点击右下角赞/分享/推荐让更多小伙伴看到👇

相关学习资料