乐于分享
好东西不私藏

会写咨询报告的 AI 不稀奇,能给每个结论配上证据链才稀缺

会写咨询报告的 AI 不稀奇,能给每个结论配上证据链才稀缺
图1  从资料来源到可信研究报告的全过程示意
核心观点:AI 写专业报告真正困难的,不是把文字写出来,而是能不能建立一条从来源、证据、判断到结论都可以回溯的完整链条。
◆ 一、AI 写得越快,证据问题越突出
现在我已经不太担心 AI 不会写报告了。真正让我担心的,反而是它写得太像一份报告——结构完整、语言专业、逻辑顺畅,以至于人在阅读时很容易忘记追问一句:这句话从哪里来的?只要继续追问,很多问题就会暴露出来:来源可能是真的,却支撑不了结论;数字可能没错,却被放进了错误的时间和口径;事实本身成立,但 AI 在事实与判断之间悄悄多走了一步。
最近,我用 DeepSeek Harness 做了一次“十五五”国企改革研究实验(详见文章我把“十五五国企改革研究”扔给DeepSeek Harness,36分钟后它交出了什么?)。在设定任务目标和基本规则后,让它连续完成资料搜集、证据整理、分析判断和报告生成。复盘这次实践后,我越来越觉得,AI 写专业报告真正困难的,不是把文字写出来,而是能不能建立一条从来源、证据、判断到结论都可以回溯的证据链。
过去咨询顾问写报告,真正耗时间的往往不是打字,而是找资料、读文件、判断来源、核对数据口径,再区分哪些是事实、哪些是判断。文字只是研究工作的最后一层。大模型出现以后,这个顺序很容易被倒过来。现在几分钟就能生成一篇结构完整的报告,“成文”越来越便宜,但验证并没有同步变便宜,于是很容易产生一个错觉:报告写完了,研究也完成了。
这次 Harness 实验里,最终报告只是九类成果中的一项。在它之前,还有资料清单、政策证据库、变化矩阵、重点方向、证据链、影响分析和行动建议;在它之后,还有《事实核验与不确定性报告》。真正的研究过程更接近“来源→证据→比较→判断→结论→回源核验”,报告只是这条链条最后的呈现。
◆ 二、更隐蔽的风险,是“真来源支撑不了这个结论”
谈到 AI 幻觉,人们最容易想到假论文、假数字。但在专业研究里,更难发现的是:来源真实存在,数字也确实出现过,却不足以支撑 AI 写出的结论。这次实验中,Harness 对来源做了分层。中央正式文件、官方发布、负责人表态、央媒报道、一般媒体和研究机构,并不被当成同等级证据。
中央文件明确提出某项要求,可以写“政策已经明确”;如果只有研究机构或媒体报道,更适合写成“有研究认为”或“这一趋势仍待官方确认”。区别看起来只是几个字,但专业含义完全不同。真正重要的不是“有没有引用”,而是这个来源究竟有资格支撑多强的结论。有链接,不等于有证据;有证据,也不等于可以直接得出任何判断。
图2  证据链四层结构与反向追溯路径
◆ 三、有些“没有写进去”的结论,反而更能说明专业性
研究过程中曾出现一个说法:“单户央企核心主业不超过 3 项、非主业投资严控在 10% 以内。”如果属实,这是很强的政策约束。但后续核验发现,它只有一家媒体报道,没有第二个独立来源,也没有找到正式政策原文,因此最终没有被当成确定政策写入报告。
另一个说法是“2030 年央企基础研究投入较 2025 年翻一番”。这一数字只来自研究机构材料,没有官方出处,因此只能作为趋势参考,不能进入“政策明确”层。我反而觉得,这两个没有被正式写成确定结论的内容,比 AI 多生成几条趋势更有价值。专业能力不仅体现在能够得到什么结论,也体现在知道哪些结论现在还不能下。生成式 AI 擅长增加内容,而专业研究同样需要控制哪些内容不能进入正式成果。
◆ 四、很多“矛盾数据”,其实只是上下文丢了
这次材料里,央企战略性新兴产业投资占总投资的比例同时出现过 41.8% 和 42%。进一步核对后发现,41.8% 是年度发布会的精确值,42% 是公开讲话中的约数,并不存在实质冲突。关于央企战略性新兴产业营业收入,材料中又出现 11 万亿元、12 万亿元和 12.3 万亿元。继续回到来源后才发现,11 万亿元对应 1—11 月累计数据,12.3 万亿元是全年完整口径,12 万亿元则是概括性表述。三个数字都可能是真的,错的是把不同时间、不同口径的数据放在一起比较。
所以,一项数字真正进入证据链,不能只保存数字本身,至少还要保留它的来源、时间、统计口径和原始表述。很多错误不是数字错了,而是上下文丢了。
图3  数字证据的五个要素:数字之外,更要保留上下文
◆ 五、比核对数字更难的,是区分事实和解释
2024 年有关改革文件明确提到能源、铁路、电信、水利、公用事业等行业的自然垄断环节改革,但后续相关规划文本的国资国企章节没有再次出现这一表述。能不能因此判断“十五五期间自然垄断改革已经降温”?不能。
“文件没有再次写”是一项事实,“因此政策已经弱化”则已经进入解释和推论。Harness 后续又找到了能源领域仍在推进相关改革的材料,因此最终没有得出“改革退出”的结论,而只是将其列为需要继续观察的边界方向。这类问题比数字错误更隐蔽。AI 很擅长把事实和解释自然连接起来,连接得越顺畅,人越容易忘记:中间其实发生了一次推论。
◆ 六、一条真正可用的证据链,至少有四层
经过这次实践,我更愿意把 AI 专业研究里的证据链拆成四层。第一层是来源,回答“它从哪里来”;第二层是证据,回答“原文到底说了什么”;第三层是判断,回答“这条证据能够说明什么”;第四层才是报告结论,回答“最终可以写到什么程度”。
更重要的是,这条链必须能够反向追溯:报告结论→判断→证据→原始来源。只要其中一层断掉,结论就应该降低置信度,而不是用更肯定的语言把不确定性掩盖起来。
◆ 七、AI 专业研究应该形成“三件套”
这次 Harness 的最后一个成果不是研究报告,而是一份单独的《事实核验与不确定性报告》,其中列出了 12 项需要进一步核实或存在争议的事实,说明哪些已经多源确认,哪些存在时间和口径差异,哪些只有单一来源,哪些仍属于推论。这个设计很值得保留。生成式 AI 天然倾向于给出完整答案,而专业工作必须允许一句话存在:目前无法确认。
所以,未来如果设计咨询类 Agent,我更愿意把标准交付物明确成“三件套”:最终报告 + 证据链 + 不确定性清单。最终报告回答“目前我们认为是什么”,证据链回答“为什么可以这么认为”,不确定性清单则回答“哪些事情现在还不能确定”。
图4  AI 专业研究的“三件套”:最终报告、证据链与不确定性清单
◆ 结语:AI 越会写,人越要知道哪些话不能写
这次实验让我越来越确信,AI 写报告最容易被替代的部分,恰恰是“写”。真正困难的是前面那条看不见的链条:找到可靠来源,从材料中抽取有效证据,判断证据能够支持多强的结论,处理不同材料之间的冲突,并在证据不足时知道什么时候应该停下来。
现在如果让我判断一份 AI 报告是否值得信任,我不会先看它写得是否漂亮,而会随机挑几个关键结论连续追问:这句话从哪里来?原文到底说了什么?它真的能直接支撑这个判断吗?还有没有相反或者尚未确认的证据?如果这些问题回答不出来,再漂亮的报告,也只是一场高质量的文字生成。真正的专业工作,不只是给出一个答案,而是知道:这个答案凭什么成立,以及我们愿意为它承担多大的责任。