一份三十页的尽调报告,第 4 页写着某家公司的资本开支是 8 亿美元,第 19 页又变成了 12 亿。
你翻回去核对,两个数字都标了出处,都像模像样。更糟的是,报告里引用的一条"重磅消息",其实只是上市前在媒体上流传的谣言,却和审计过的财报并列,语气一样笃定。
这不是虚构。这是亚马逊 AWS 生成式 AI 创新中心在给客户做长报告时,反复撞见的三种翻车。他们写了篇论文,把病根和药方都摊开了。
AI 写长文,真正的死穴不是写得不够好,而是它自己会跟自己打架。
先说病根。长报告有三种典型的翻车方式。
第一种,数字漂移。同一个指标,在"营收"章节是一个数,在"资本密集度"章节是另一个数。为什么?因为每个段落是独立让模型查资料、独立生成的,没有一本账把它们对齐。
第二种,溯源丢失。数字冒出来,却查不到出处。读者分不清,这个数是审计过的财报,还是模型顺着语感编出来的幻觉。
第三种,信任扁平化。上市前的谣言,和已经提交的 10-Q 财报,被同样自信地引用。因为系统里压根没有"来源权威"这回事。
你会发现,这三种翻车,都指向同一个根子——RAG 是"查一次、答一次",每次都是临时翻资料,从来不维护一本持续演化的账。

所以呢?所以 AI 写短问答还行,一写长报告,前后矛盾、丢出处、把谣言当财报,全是必然,不是偶发。而且报告越长、越要紧,翻车越致命。
那亚马逊怎么治?一句话:别让 AI 动笔时才去查资料,先让一个"图书管理员"把资料整理成一本账本,AI 只负责照着账本念。
他们搭了个两层系统,我拆给你看。
第一层叫"图书管理员",而且它是确定性的,几乎不靠大模型。它干三件事。
先把每一份来源按信任分档。美国证监会的财报是"官方",劳工统计局的宏观数据是"政府统计",维基百科是"媒体"。分档不是摆设,是有规矩的:媒体只能用来指路,永远不能变成一个能被引用的硬数字。
接着,把每个事实抽成一张"证据卡",每张卡都钉死在原文的某句话上。哪个数字,来自哪份文件的哪一句,一查到底。
最后,对每一个"公司+指标",选出一个权威值,写进一本"指标账本"。选法也死板:官方优先,同档再看谁被更多独立来源印证,最后才看时间。
这套流程,像不像账房先生对账?官方数字压过小道消息,互相印证的压过孤证,时间只在对完前两关之后才起作用。
给你看个真账本长什么样。论文里追了 Oracle 的"剩余履约义务"这个指标:权威值 6380 亿美元,下面挂着三个历史值——5526 亿、5233 亿、4553 亿,每个都标着日期,还标了"是否矛盾"。账本不删旧值,只是用一条"取代"的边,让新财报压过旧财报。旧账不丢,新账优先,每一笔都有据可查。
第二层,才是写作团队——一群 Agent。但它跟你想的不一样。
每个章节一个 Agent,并行去写。碰到有争议、有冲突的章节,派贵模型去啃;平平无奇的章节,派便宜模型去写。钱花在刀刃上。
写完不是直接交。每个章节后面跟着一个独立的"检察官" Agent,专门红队式地挑刺,一门心思把稿子驳倒。
最关键的一点在这——这些 Agent 彼此之间,一句话都不说。它们不靠对话协调,而是通过那本共享账本协调。
因为每个指标在账本里只有一个权威值,两个章节哪怕同时写,物理上也不可能引用出两个不同的数字。并行写作通常最怕的"各写各的、写到打架",在这里被结构性地消灭了。

这里藏着三个容易被忽略的细节,每一个都值钱。
第一个细节,叫"时间点投影"。报告是"截至某天"的,就只能看到那天之前到账的证据,之后的东西一概看不见。这就是"不提前偷看"的规矩。他们回放了七个时间点,零违规,账本从 23 万张证据卡一路长到 55 万张,单调增长,没有一次看走眼。
所以呢?所以你的报告"截至 12 月 31 日",就不会混进 1 月才发布的修正数据。这份克制,恰恰是投行最看重的——不提前偷看未来,是报告可信的前提。
第二个细节,是最后那道质量门禁——它不是让大模型自己给自己判卷,而是一段确定性的代码,跑六条硬规则。 孤引用、无源数字、跨章节矛盾、埋着的矛盾……六条不过,报告直接不放行。他们用"故意埋雷"的方式验证过这道门:五个真缺陷全抓到,三个干净样本零误报。
为什么这点重要?因为让 LLM 自己评价自己的输出,等于既当运动员又当裁判。机械检查,才敢信。
第三个细节,是"写回循环"。检察官驳倒一个数字,不会只是删掉它,而是把这个"驳倒"写回账本,把那个来源降级。下次跑,账本自动改用早已存在的替代值。论文里有个真实案例:利息数字从 1900 万美元自动纠正到 900 万美元,零人工改值。 五个同类案例里,四个自己纠正了过来。
你发现了吗?这套东西的价值不在"某一次写得对",而在账本只会越对越准,因为每一次纠错都被沉淀下来,而不是用完就丢。
那这个思路能复制到哪?凡是"长文 + 数字 + 必须可溯源"的地方,都吃这一套。
投行研报、尽调备忘录、行业研究。法律尽调、合规审计报告。学术综述、政策研究报告。你现在用 AI 写的任何一份"要拿给客户看、要被追责"的长文档,都踩在这三个翻车的坑边上。
亚马逊这套东西,本质上是一句话——把"写作"和"资料维护"拆开。先老老实实对一本账,再让 AI 照着账本写。
所以呢?所以你现在就能动手做三件事。
第一件,给你的知识库加一层"来源分档"。官方文件、权威机构、媒体小道消息,分清楚,定一条铁律:低一档的来源,永远不能顶掉高一档的数字。
第二件,把"最终检查"从让模型自己评,换成确定性规则。至少两条硬规则你今天就写得出:这个数字有出处吗?这个数字在全文里只出现了一个值吗?
第三件,把资料维护和写作分开。别每次写都从零翻资料,先维护一本会沉淀、会纠错的账,AI 只是照着账本说话的嘴。
AI 会写,从来不是新闻。AI 写得每个数字都钉得死出处、前后不打架,才值得你把手里的长报告交给它。
聪明让 AI 能写,老实才让 AI 能被信。
夜雨聆风