ARTICLE · 1138273
AI 工具实测:给 AI 加句「不确定就说不知道」,它开始乱认怂
上一期我们聊了让 AI 改错别字反被塞了 17 个新错,当时留了个尾巴:给 AI 加一句"不确定就说不知道",它是不是真就少犯错了。
我实测了一个月,结论有点出乎意料。
先说结论:这句话有用,但副作用比你想的大。我现在已经把它从提示词里删了。
40 道题的对照实验
方法很土:准备 40 个问题,其中 30 个有明确标准答案(我能查证),10 个是我故意埋的"陷阱"——答案根本不存在,比如某个我瞎编的冷门函数名、某份不存在的行业报告。
每个问题问两遍。
A 版:问题前面加一句"不确定就说不知道,不要编造"。
B 版:什么都不加,直接问。
结果分成两半看:
好消息是,A 版确实更老实。10 道陷阱题,B 版里它一本正经编了 7 次,还给那个不存在的报告编了发布机构;A 版只编了 3 次。40 道题总的编造次数,从 17 次降到 9 次。
坏消息在另一半。
反转:它没少编,只是换了个编法
第一个意外:那 30 道有标准答案的题里,A 版说"不知道"的有 12 道,B 版只有 2 道。
也就是说,它把谨慎用错了地方——该认怂的确实认了,不该认的也一起认了。我拿一道很基础的问题试过:不加那句话它对答如流,加了之后它回我"这个我无法确认,建议你查阅官方文档"。
第二个意外更狠:A 版有 5 次,嘴上说着"我不确定",后面紧跟一句"不过一般来说……",然后照样给了一整套数字和结论。
禁令是被绕过去了,不是被遵守了。
我后来想明白一件事:你让它"不确定就说不知道",等于让它自己去判断"我确不确定"。而它对自己什么时候在编,本来就没有靠谱的感知——你把一个它做不到的判断,当成了一道保险。
我现在问的不是"确不确定",是"凭什么确定"
删掉那句咒语之后,我改成三步,实测比它稳得多:
第一步:不让它判断,让它分类。 把"不确定就说不知道"换成"每个结论后面标一下:来自我给的材料 / 来自常识 / 你自己推测"。它很擅长贴标签,不擅长自我评估。这一步之后,我一眼就能看出哪几行要核。
第二步:推测的单独列出来。 "推测的部分请放在最后,单独一段,别跟结论混在一起。" 混在一起的时候,你会不自觉地把推测当成结论读。
第三步:给它一条真正的退路。 "如果你觉得信息不够,别猜,直接告诉我你需要我补什么。" 这句是关键——它终于有事可做了,不用靠编来把对话撑完。
同样的 40 道题再跑一遍:编造 6 次,该答对的 30 道里只误伤了 3 道。比原版和咒语版都好。
三个坑,我全踩过
坑一:只说"别编",它不知道什么叫编。 在它眼里,"73% 的用户倾向于"和"水在 100 度沸腾"都是输出一句话。你得给可执行的判定标准,比如"材料里没有的一律不许出现"。
坑二:"不知道"会传染。 一旦你鼓励它认怂,它会倾向于多认。特别是你连着问了几个偏门问题之后,后面简单题它也开始保守。
坑三:最危险的是那些你没法验证的回答。 这类问题上,它说"不知道"你也无从判断真假,说"知道"你同样无从判断。真正的防线不在提示词,在你有没有留核实的习惯。
写在最后
能直接带走的就一句:
别问它"你确不确定",要问它"你凭什么确定"。
前者是在要态度,后者是在要证据。AI 最不缺的就是态度。
这是「AI 工具实测」系列的新一篇。下一期想测个更日常的:为什么让 AI 先写大纲,反而更容易写出一篇看着完整、读着空洞的稿。
先问一句:你现在写提示词,还会加"不确定就说不知道"吗?评论区报个到,顺便说说它给你编过最离谱的一次。