乐于分享
好东西不私藏

AI 为什么总能说得通,却未必说得对?

AI 为什么总能说得通,却未必说得对?
"它不是撒谎,而是在补全答案。"专栏:与AI共事

同事把一段 AI 生成的行业总结发到群里。它有结论、有数据、有三条像模像样的引用,语气也很笃定。大家顺着它讨论"这意味着什么",很少有人先打开链接,看看那几条资料是否真的存在、是否真的支持这段话。

AI 最容易让人放下警惕的时刻,不是它答得含糊,而是它答得太像一个成熟答案。

这不是说模型没有价值。它能把零散信息组织成提纲,帮人快速提出问题,也能把难读的资料改写得更易用。但"看起来完整"与"可以采用"之间,仍然隔着一截需要人自己走完的路。

01它不是在回答,而是在补全答案

美国国家标准与技术研究院(NIST)在生成式 AI 风险指南中用了一个专门的词:confabulation(虚构)。它描述的是这样一种现象——系统自信地生成错误、虚构、偏离输入或自相矛盾的内容,里面甚至可能包含看似能支撑答案的逻辑和引用。

这类输出之所以难防,不是因为它总在胡说,而是因为它经常把正确的词、熟悉的结构和合理的语气拼在一起。语言模型本质上是在已有上下文里续写"最像答案"的内容。它能给出准确回答,也会在信息不足时继续补全,而不是停下来承认"不知道"。OpenAI 自己也提醒过,聊天模型可能编造引语、研究、引用或不存在的来源。

所以,把模型错误简单说成"撒谎"并不准确。它没有人的动机。真正值得警惕的是我们的习惯:当一段文字足够顺、足够像报告,我们很容易把阅读时的顺畅感,误当成事实已经成立。

02一个数字,是怎么滑进决策链的

去年一家中型咨询公司做零售行业趋势分析时,让 AI 生成了一份竞品对标报告。AI 引用了"麦肯锡 2025 年全球零售白皮书",声称某头部企业"通过 AI 选品将库存周转率提升了 37%"。项目组没有核实,直接写进了给客户的方案。

后来客户追问出处,团队才找到那份白皮书——麦肯锡确实发布过同名报告,但原文说的是"部分试点门店提升了 12%~15%",而且是在特定品类、特定季节下的结果。"37%"完全是 AI 自行拼凑的数字。最终客户流失,团队花了两个月重建信任。

这个案例说明了三件事:

  1. AI 可以凭空捏造数字;
  2. 捏造时,它会挑一个真实存在的机构名字,来增加可信度;
  3. 只要没有人去打开原文,错误就会一路滑进决策链。
03有引用,不等于已经有证据

AI 输出里的引用,至少有三种常见问题:

  1. 来源根本不存在,或链接打不开;
  2. 来源存在,但原文并不支持 AI 的结论——就像上面那个例子;
  3. 原文在特定条件下成立,AI 却把它搬到了完全不相关的场景里。

比如,AI 说"某类工具正在成为增长最快的市场",并附上一份报告。这里至少有四件事必须先确认:

  1. 报告是哪一年的?
  2. "增长最快"指的是收入、用户数还是融资额?
  3. 统计范围是全球还是某个区域?
  4. 原文是否真的比较了所有相关品类?
「一个蓝色链接,只能说明它给出了线索,不能替人完成这些判断。」

2026 年 4 月,中央网信办专门部署整治 AI 应用乱象,重点包括利用 AI 生成虚假信息、假冒仿冒和批量发布低质同质内容。这提醒我们:核验不是研究人员的额外仪式。AI 输出一旦进入群聊、方案、内容或决策链,错误也会跟着文字的速度一起传播。

04核对、打开、检查:三层验证法

不必把每次使用 AI 都变成论文审查。日常工作里,可以先做这三层验证。

第一层:核对主张。 把 AI 的回答拆开看——哪一句是可核验的事实,哪一句是根据事实作出的推断,哪一句已经走到了行动建议。三种句子的可信度不同,不能同等对待。

第二层:打开来源。 对会影响判断的事实,优先找到原始报告、官方文件、论文原文或公司公告。搜索摘要、二手转述和打不开的链接,都只能算线索,不算证据。

第三层:检查条件。 即使来源可靠,也要看它是否适用于此刻:时间是否过期,地区是否一致,对象是否相同,原文有没有被省掉限定条件。很多"看起来引用了资料"的错误,就发生在这最后一步。

05做对了,是什么样

假设你要用 AI 起草一份政策摘要。不要直接问"请总结 XX 政策的影响",而是分两步。

第一步:让 AI 列出事实骨架。 比如这样问它:

请列出 XX 政策的发布机构、原文日期、适用对象、核心条款,以及文本中没有明确说明、但仍存争议的问题。

第二步:拿到骨架后,自己打开原文确认一两个关键点。 比如找到政策原文,核对"适用对象"是否真的是 AI 说的"所有中小企业",还是"仅限注册满三年的科技型中小企业"。

如果 AI 答不上来某一项,就把它标为"待确认",不要为了让方案显得完整而强行补成肯定句。人不必替 AI 重写材料,只要分清:哪些空白可以暂时存在,哪些空白必须在行动前填上。

06有些答案,不能只靠点开链接

对格式固定、后果可回滚的低风险任务,三层法可以很轻:核对一两个关键事实即可。

但涉及医疗、法律、投资、重大采购、人员评价、敏感数据或不可逆决策时,AI 输出只能是线索或初稿。此时需要权威资料、明确的审批路径,以及具备相应职责的人来复核。NIST 的风险管理框架同样强调:AI 的可信使用要放在具体场景、目标和风险承受能力中判断,而不是只看模型回答得是否漂亮。

可信的工作系统,不要求 AI 从此不犯错。它要求人在答案出现以后,仍然保留一个位置给"不知道"——不知道就标出来,引用就打开,结论要看条件,重要决定不跳过责任。

「下一次看到一段很顺的 AI 输出,先别急着问"它写得好不好"。先问一句:这段话,凭什么成立?」