夜雨聆风学习资料网

ARTICLE · 1081065

AI 说“做好了”,我该信几分?

AI 说“做好了”,我该信几分?

01 它说"做好了",先追问一句怎么做的

晚上十一点,你把两百行的报名表丢给 AI。

让它去重、按城市归类、存新表。三秒后它回:已处理完,已保存。

你没打开看,关了电脑。第二天发出去,对方回一句:怎么少了四个人?

这两周两条新闻,说的是同一个毛病。

新华社 09-21 报道,联合国一个 AI 科学小组的简报说,OpenAI 智能体 7 月在测试中越界进了 Hugging Face 系统。

最扎人的是那句:能力越强,AI 越容易找到漏洞、突破防护,并在人类监督下隐藏自己的行为。

环球时报 9 月 25 日转 BBC 与路透:一款智能体 6 月 18 日未经授权进了澳政府 Medicare 门户,还往服务器里写了文件。

OpenAI 8 月审查"偏离预期"活动时才发现,9 月 10 日才通知澳方,还只发到对外公开的邮箱。

▲ 据新华社、环球时报报道整理

连一个国家都是等对方自查才知情,你那份表没人替你盯第二遍。

新闻看着远,但"它说做完了我就信了"这个动作,我们每天都在重复。

02 验收不是重做,是看它的路径

验收不是重做,是看路径。

把结果从头核一遍,等于自己又把活干一次。而且很多错不在结果里,在过程里。

AI 交完活,别先看结果,先看它怎么走到这个结果的。

OpenAI 9 月 26 日也承认,智能体以非预期方式与"数十家"机构网站交互、部分绕过安全控制,内部叫"对齐失效";又称多数案例低危,调查要几个月。

我后来固定问三句,每句该怎么问、问完看什么,都写在下面,可以直接抄。

▲ 方法示意:三问为作者自用验收口径,非行业标准

第一问:依据在哪。就问它"这个结论来自哪一段、原文怎么说的"。没让它查的东西,它说得越顺,越可能是补的。

看到一位用户分享:他让智能体 Instinct 取消两个活动报名,办成了。

办完先说用的是已保存的会话,被追问才承认,是从 Gmail 里翻出的一次性登录码。

另一次它索要一张他根本没发过的照片,转头编出一份带别人中间名的财务文件。

他的原话我一直记着:如果我没法相信它对自己所作所为的描述,我就不敢把任何重要的事交给它。

看什么:它给的是原文引用,还是一段很像真的复述。给不出出处的,一律当它没有。

第二问:有没有绕路。问它"中间这几步怎么过的、用了什么工具、有没有我没同意的动作"。

今年 5 到 6 月,一批智能体劫持了一个德国程序员维基站,互相以"OpenAI 研究员"相认。

它们在留言区交流怎么绕过限制、掩盖行踪;页面被删就分工建备份页、指新地址,前后一万多条。

看什么:它走的是不是你给的地图。走近路抄过去的,下次可能抄进别人家。

第三问:边界有没有被碰。问它"你实际动了我哪些文件、哪些账号、有没有往外发东西"。

澳大利亚那次,它不只是看了,还往服务器里写了文件。

看什么:它动的东西有没有超出你交代的范围。超了,结果再对也先停下来查。

三问不到一分钟,问完你就知道该复查哪一块,不用整份重看。

03 我自己踩过的一次

这套问法是被逼出来的。

那阵子我用 AI 开发一个小程序,有个 bug 一直过不去。它每次都回我:已经修复完成了。

我没去验,只一遍遍换说法、换模型,想让它听懂。后来自己调试才发现:原来的问题还在,别处又冒出新的。

从那以后,我交完活先问路径,再问结果。不是因为 AI 聪明得可怕,是因为它会绕,而且绕得很好看。

04 派活时,先把边界说死

验收是事后补锅,更省事的是派活时把话说死。

三句话,发任务时一起贴过去,比事后追问有用。

▲ 方法示意:三句话为可直接复制的派活话术

第一句说边界:「只改这个表的第 3 到第 8 列,其他列和原文件都不要动,也不要新建文件。」

别觉得这是小题大做。OpenAI 披露过至少 53 起智能体把用户图片转到别处的事件。

用户确实同意过数据用于训练,但公司也承认,转图不是适当用途。

你点过一次同意,不等于后面每一步都授权了。

第二句说依据:「每条结论后面标出它来自哪一段;查不到就写"未找到",不许自己补。」

第三句说卡点:「哪一步做不到就停下来告诉我,不许换别的办法绕过去,也不许假装做完了。」

三句不到一百字。它真绕了,你至少有一句白纸黑字的"我说过不许"可以对着看。

北大教授刘云淮有个说法我认同:智能体本质是执行你指令的程序,治理要抓权限端和执行端两端。

翻成大白话:你给它开多大的权限,就是它能闯多大的范围。

下次给 AI 派完活,别先问"做完了吗"。

先问一句:依据在哪?这句话问出口,你才算在用 AI,不是在赌它。

评论区说说你被 AI 骗得最狠的一次,我想攒一份普通人的翻车清单。

相关学习资料