AI最危险的答案,往往不是明显的胡说,而是那种读起来很顺、细节很全、让人懒得再查的答案。普通人不必怀疑每句话,但一定要学会按风险核验。
● ● ●
它写得这么像真的
你让AI帮忙查一项政策。
它很快给出文件名称、发布日期、适用人群,还贴心地列了三条注意事项。格式漂亮,语气肯定,看起来比自己搜索半小时还专业。
你顺手复制进了工作群。
同事打开所谓的原文链接,发现页面不存在。再查文件名称,也没有这份文件。
最尴尬的地方不在于AI答错了,而在于:它答错时,样子和答对时几乎一样。
没有皱眉,没有停顿,也不会因为心虚把声音放小。它照样分点、加粗、给结论。
OpenAI把这类现象称为“幻觉”——模型生成了听起来合理、实际上不正确的内容。更麻烦的是,模型可能捏造日期、引文、论文,甚至一本正经地给出并不存在的来源。
所以今天不讨论哪个模型的错误率更低。模型会继续升级,但普通人需要先拥有一项不会过期的能力:知道什么时候可以直接用,什么时候必须停下来查。

AI答案看起来专业,不代表内容真实
● ● ●
先别走向另一个极端
听到“AI会犯错”,有人会得出一个很累的结论:那我是不是得把每句话都查一遍?
不用。
让AI把一封自己写过的邮件改得更客气,哪怕它把“感谢理解”换成“感谢配合”,通常也不会造成严重后果。让它给周末晚餐列几个菜单,也没必要给每道菜找两篇论文。
但如果它告诉你某种药可以和另一种药一起吃,或者一份合同“签了肯定没问题”,情况就完全不同。
判断标准其实只有一个:这条答案如果错了,代价有多大?
错了只需改几句话:低风险,可以快。 错了会让别人误解、耽误工作:中风险,需要核对关键事实。 错了可能损失金钱、影响健康、触碰法律或暴露隐私:高风险,必须慢下来,并找专业人士确认。
我越来越觉得,普通人使用AI最重要的不是“相信”或者“不相信”,而是会调整信任的档位。
把所有答案都当真,容易翻车。把所有答案都重新查一遍,AI又失去了意义。

根据错误代价,把AI答案分成低、中、高三个风险等级
● ● ●
四步核验法:停、找、对、定
这套方法不复杂。我把它压成四个字:停、找、对、定。
它不保证答案百分之百正确。说实话,没有任何一句提示词能做到这件事。它的作用是帮你在点击发送、付款、签字或照着执行之前,多设置几道便宜的刹车。
第一步:停——圈出真正需要查的句子
不要从头到尾逐字审讯AI。先圈出答案里的“硬信息”:
人名、机构、日期和数字; 政策、法规、合同条款; 论文、报告、新闻与引文; 涉及价格、剂量、资格和截止时间的结论; 会直接影响下一步行动的判断。
比如AI写了500字购物建议,真正需要核验的可能只有三处:产品是否支持某项功能、保修期到底多久、优惠什么时候结束。
先抓关键句。别被整篇流畅的文字拖着走。
第二步:找——让答案回到原始来源
可以让AI提供来源,但“它给了链接”不等于核验结束。
链接可能打不开,标题可能对不上,原文也可能根本没有支持它的结论。你要做的是打开来源,找到对应段落,看清发布者和发布日期。
来源也有远近:
查产品功能,优先看产品官网和使用说明; 查政策,优先看政府部门正式文件; 查健康信息,优先看卫生机构、正规医院和专业指南; 查公司动作,优先看公司公告,而不是二手转述。
2026年,世界卫生组织介绍过一款健康信息工具ChatHRP。它提高可靠性的办法不是让AI“说得更像医生”,而是把回答限制在WHO和HRP的资料里,并让内容能够回到经过验证的证据。
这给普通人的启发很直接:可靠的答案应该能带你回到证据,而不是只让你佩服它的语气。
第三步:对——检查时间、原文和第二个来源
找到了来源,还要做三次对照。
对时间。 规则、价格、产品功能会变。2024年正确的说明,到2026年可能已经失效。
对原文。 AI可能引用了一篇真实文章,却把文章中的“可能”说成“已经”,把“部分人适用”说成“所有人适用”。
对第二个来源。 重要结论最好再找一个彼此独立的可靠来源。两个网站转载同一篇稿子,不算两份证据。
这里有个小坑:让同一个AI“再检查一次”,并不等于交叉验证。它可能只是换一种说法重复原来的错误。
你可以换搜索渠道、换数据库,或者直接查看原始文件。高风险问题则应当问真正承担专业责任的人。
第四步:定——由人决定能不能用
核验完成后,不是问“AI到底可信不可信”,而是做一个具体决定:
可以直接采用; 修改后使用; 只当作线索; 暂时不用,继续确认。
世界卫生组织在2026年有关AI和循证健康政策的讨论中,强调自动检索应当与人工核验结合,并保留由人做决定的关口。这个原则并不只属于专家。
AI可以帮你找、帮你读、帮你比较,但点击发送的人是你,签字的人是你,承担结果的通常也是你。
这一步没法外包。

普通人核验AI答案的四步法:停、找、对、定
● ● ●
三个普通场景,分别查到什么程度
四步法听起来规整,真正使用时并不需要每次都做满。按场景来。
工作资料:查数字和出处
假设你让AI写一页行业简报。
观点和结构可以让它先搭,但所有具体数字、市场规模、公司名称和政策日期,都要回到出处。来源打不开的数字,宁可删掉。
还有一句我自己常用的检查问题:
如果领导只追问一个数字,他最可能问哪个?我能在30秒内打开原始来源吗?
做不到,这个数字就不该出现在正式汇报里。
购物决策:查条件,不查形容词
“很适合家庭使用”“性价比很高”“广受好评”,这些话看起来有用,其实很难验证。
真正该查的是具体条件:尺寸能不能放下、接口是否兼容、退换规则是什么、耗材一年大概多少钱。
AI适合帮你列比较项目,不适合替你决定什么叫“值得”。你的预算、使用频率和容忍程度,它只能从你提供的信息里猜。
健康信息:只把AI当作准备工具
这个场景要单独说一句:不要根据一段AI回答自行停药、换药或判断急症。
AI可以帮你整理症状出现的时间,解释报告里的陌生词,或者列出就诊时要问医生的问题。它可以让沟通准备得更好。
但诊断、药物剂量和治疗决定,需要结合病史、检查与当面判断。WHO也曾提醒,大语言模型可能产生错误或误导性的健康信息。
别拿“它说得很具体”当安全证明。越是具体到剂量和操作,越要谨慎。

工作、购物和健康信息需要不同程度的核验
● ● ●
一段可以直接复制的“自检提示词”
提示词不能把AI变成事实机器,但可以让它把不确定的地方暴露出来。
你可以在重要回答后追加这段:
请不要继续扩写。现在检查你刚才的回答: 1. 列出其中所有需要外部核验的事实、数字、日期和引用; 2. 为每一项提供可打开的原始来源,并标注来源发布日期; 3. 明确指出哪些内容只是推测、经验判断或信息不足; 4. 如果无法确认,请直接写“无法确认”,不要补全或猜测; 5. 最后列出我在采取行动前仍需人工确认的事项。注意,它输出的“来源”依然要由你打开。
我试过不少花哨提示词,真正能减少麻烦的往往不是“你是一位世界级专家”,而是允许它承认不知道,并要求把事实和判断分开。
OpenAI关于模型幻觉的研究也提到一个很有意思的问题:如果评价只奖励猜对,却不给“我不知道”留位置,模型就更容易选择猜测。对用户来说,一个愿意暴露不确定性的答案,往往比句句肯定的答案更值得继续核验。

让AI主动列出事实、来源、不确定性和人工确认项
● ● ●
以后看到AI答案,先问这5句话
如果四步法一时记不住,就记下面五问:
- 01
这件事错了,代价大不大? - 02
哪一句是会影响行动的关键事实? - 03
它的原始来源在哪里,我打开看了吗? - 04
来源现在还有效吗,第二个可靠来源怎么说? - 05
这件事应该由谁判断、谁负责?
五句话问完,大多数“看起来很对”的答案就会露出边界。
有些可以放心拿来改邮件、整理资料;有些只能作为搜索线索;还有些必须停在屏幕里,不能进入现实行动。

使用AI答案前必须问自己的五个问题
● ● ●
写在最后
过去我们判断一段信息靠不靠谱,会看是谁说的、在哪发表、有没有证据。
到了AI这里,这套习惯不能丢。
甚至要更认真一点——因为AI太会组织语言了。它能把一个不确定的猜测写得完整、顺滑、像一份已经核准的结论。
普通人不需要成为事实核查专家,也不用因为一次错误就彻底拒绝AI。
记住一个原则就行:使用答案的速度,不能超过你承担错误的能力。
低风险的事,让AI帮你快一点。高风险的事,让证据和专业判断把速度降下来。
AI负责给出第一版。
你负责决定,它能不能进入真实世界。
参考资料
OpenAI:Why language models hallucinate OpenAI Help Center:Does ChatGPT tell the truth? NIST:Artificial Intelligence Risk Management Framework — Generative AI Profile WHO:New discussion paper sets out opportunities and risks of AI in evidence-informed health policy WHO:Finding sexual and reproductive health and rights facts fast
夜雨聆风