夜雨聆风学习资料网

ARTICLE · 1097255

AI写得越来越像真的,我现在只用这4步检查来源

AI写得越来越像真的,我现在只用这4步检查来源

AI写得越来越像真的,我现在只用这4步检查来源

AI回答先查来源

现在让 AI 回答一个问题,它常常不只给结论,还会附上作者、年份、研究名称,甚至列出几个看起来很正规的链接。

麻烦也出在这里。

以前遇到一段明显混乱的回答,我们很容易保持警惕。如今的回答结构完整、语气确定、细节丰富,读起来像一份已经查过资料的报告,人反而更容易直接相信。

但“像真的”和“可以验证”之间,还隔着几步。

OpenAI 在关于语言模型幻觉的研究说明中,把幻觉描述为模型生成看似合理、实际错误的陈述。即使模型能力提高,这个问题仍没有彻底消失。美国国家标准与技术研究院的生成式 AI 风险框架也把这类自信但错误的内容列为需要管理的风险。

所以,我现在不会要求自己逐字核查 AI 的所有回答。那样成本太高,也没有必要。我只检查那些准备继续使用的内容:要写进文章的事实、要放进报告的数字、会影响决定的规则,以及可能被别人引用的结论。

具体只做四步。

AI回答到可信结论的四步

第一步:把完整回答拆成可以核查的主张

AI 给出的通常是一整段话,但事实核查不能对着“整体感觉”进行。

例如它说:

> 某款产品在 2025 年发布,上线三个月获得数百万用户,因此被认为是增长最快的 AI 产品之一。

这句话至少包含四个主张:

- 产品何时发布;- 三个月后有多少用户;- 用户数采用什么口径;- “增长最快”在和谁比较。

只要其中一个数字是真的,整句话就可能显得可信;可剩下的内容仍可能没有依据。

我会先圈出人名、时间、数字、版本、价格、政策和因果关系。这些内容一旦写错,文章的判断就会跟着偏离。至于“体验不错”“值得关注”这类主观判断,则需要说明是谁的判断,不必假装它是客观事实。

这一步的目的,是把一段漂亮文字变成一张待办清单。

第二步:沿着链接走到原始来源

AI 给出一个链接,不等于它已经提供了证据。

先看链接能不能打开,再看页面是谁发布的,最后确认页面是否真的支持那句话。

如果文章讨论产品功能、价格和使用限制,我优先找产品官方文档;涉及公司财务数据,优先找财报或监管披露;涉及研究结论,尽量回到论文和研究机构页面;涉及法律政策,则查看政府或主管机构公开文件。

新闻报道、博客和社交媒体可以提供线索,但它们经常转述同一个源头。五篇文章都引用同一条未经核实的消息,并不能算五份独立证据。

还有一种常见情况:链接确实存在,标题也和问题相关,但正文没有 AI 所说的数字。此时应把它视为“没有找到依据”,不能因为链接看起来正规就替 AI 补上证明。

线索、转述与原始来源

第三步:检查时间和上下文

不少错误并非完全虚构,而是把过去的事实放进了今天,把测试阶段的规则写成正式规则,或者从长文中抽出一句失去条件的话。

检查来源时,我会特别看四个位置:

- 页面发布日期和最后更新时间;- 数据对应的统计区间;- 结论前后的适用条件;- 页面是否已经被新版本替代。

例如某项功能曾经只向付费用户开放,后来可能扩大范围;一份模型评测在特定数据集上领先,也不能直接推出它在所有真实任务中都更好;一位受访者说“我们计划推出”,不能写成“已经正式发布”。

网页上的一句话没有离开原文,但离开时间和条件以后,含义仍然可能变掉。

这也是为什么我不喜欢只截一张搜索结果或 AI 摘要作为证据。它让人看到了结论,却看不到结论成立的范围。

第四步:用独立来源交叉确认

重要信息最好不要只依赖一个页面。

所谓交叉确认,并不是再搜索一遍,找一个措辞相似的结果。需要判断第二个来源是否真正独立。

如果两篇媒体报道都来自同一份公司新闻稿,它们只能算一条来源链。如果一份官方公告给出发布时间,另一份公开产品页面证明功能已经上线,这两者才分别支持不同环节。

我通常这样分工:

- 原始来源确认“发生了什么”;- 独立来源帮助理解“这件事意味着什么”;- 自己明确写出哪些是事实,哪些是解释。

对于会影响健康、法律、财务和重大工作决策的问题,普通的两次搜索仍然不够,需要查阅对应专业机构的信息,必要时让有资格的人参与判断。AI 可以帮助整理问题,不能替代应当承担责任的人。

哪些信息值得优先核查

有些回答,不值得花十分钟核查

事实核查也需要成本。

如果只是让 AI 帮忙改一个标题、列几个头脑风暴方向,或者解释一个不会直接影响行动的常识,没有必要把每句话都做成研究项目。

我会优先核查四类内容:

会公开传播的。文章、视频和公开演讲中的事实会被继续转述。

会影响决定的。采购、选型、工作安排和学习投入都可能产生真实成本。

具体得异常漂亮的。精确数字、完整书名、论文作者和明确日期,最容易让人放松警惕。

与原有认知冲突的。反常识结论可能带来新发现,也可能只是模型把几段材料拼错了。

判断风险以后再决定核查深度,比一味相信或一味不信都更实用。

让 AI 参与核查,但不要让它自己证明自己

AI 仍然可以帮助完成很多准备工作。

你可以让它把回答拆成待核查主张,给出适合寻找的来源类型,提取网页中的时间、对象和限制条件,也可以比较两个来源是否在谈同一件事。

但不要只问原来的模型:“你确定吗?”

它可能换一种更坚定的语气重复同一个答案。更有效的问法是:

> 请把这段回答中的事实主张逐条列出。对每一条说明需要什么原始来源才能证明;没有证据的地方标记为“待核查”,不要补充猜测。

接下来仍要打开来源,由人确认页面内容和准备写下的句子是否一致。

AI 能降低整理线索的成本,却没有把验证责任一起拿走。

流畅是一种表达能力,证据才决定能不能相信

过去我们容易把写得像不像专业文章,当作内容是否可信的线索。生成式 AI 让这种判断越来越不可靠。

真正需要养成的习惯,是把内容分成三层:模型说了什么,来源实际写了什么,我基于这些材料作出了什么判断。

三层分开,出现错误时才知道应该改事实、换来源,还是调整自己的解释。

以后看到一段漂亮的 AI 回答,不必立刻怀疑一切,也别急着复制。先圈出关键主张,找到原始来源,检查时间和上下文,再找独立证据交叉确认。

四步走完,答案可能没有刚出现时那么完整,却更接近可以放心使用的内容。

这是《AI时代,普通人重新建立自己的20个问题》第1篇。

下一篇想聊:第一次把 AI 接进工作流程,先划分哪三类数据?

资料来源

- OpenAI:语言模型为何会产生幻觉- NIST:生成式人工智能风险管理框架

相关学习资料