核心判断
未来不是把文档写给AI,而是先把知识组织成可寻址、可验证、带来源和状态的对象,再分别生成机器上下文和人类阅读视图。
事实边界
公开证据支持部分模型的可无损压缩冗余、自动评审的长度偏好、跨作品内容趋同及神经检索来源偏置;尚不足以证明所有企业AI文档的单篇信息密度都已大幅下降。标题中的“不值钱”指仅有完整外观、不能证明来源与状态的文档,不包括合同、监管、董事会和责任冻结所需的正式快照。
过去,写一份完整报告很贵。
你要找资料、核数字、组织论证、协调意见,还要承担结论被追问的压力。于是,“完整”虽然不等于正确,至少意味着有人为这份东西付出过成本。
生成式AI把这道门槛拆掉了。只要一句提示词,标题、摘要、目录、正文、风险和行动项可以同时出现。我们第一次进入一个“完整成果”比“新事实”增长得更快的时代。
AI把“像一份文档”变得廉价,却没有把新事实、独立判断和责任承担变得廉价。
十年后,企业里最不值钱的,很可能就是那些结构齐全、语言流畅,却没有新增事实、没有来源、没有责任人、也不知道是否仍然有效的“完整文档”。
一、AI已经不只是回答问题,而是在批量制造成果
Anthropic在2026年6月26日发布了一份Economic Index报告。它对2026年4月10日至6月10日抽样的Claude Chat和Cowork会话进行分类:93%的会话产生了某种可识别成果;文档与报告占全部会话的15%。只看工作类会话,文档与报告占20%,是最常见的产出。[1]
报告还比较了生成博客和文章的交互方式。Chat与Cowork的中位数是13轮往返,Claude Code的中位数只有一次人类提示。[1] 这不等于Claude已经独立完成所有文章。不同产品上的任务构成和用户选择并不相同。但它说明,随着AI从对话框变成可以持续运行的工作界面,同一类成果正从协作写作走向整项委托。
这组数据只代表Anthropic自己的产品,不能外推成整个企业市场。它也没有测量文档质量。但一个趋势已经很清楚:AI最先做便宜的不是知识,而是知识的包装。

图1|93%的Claude Chat/Cowork会话被分类为产生某种成果;这证明产出形态变化,不证明信息密度下降。
生成一份文档几乎免费,保存它却不是。它会占用索引、检索位置、维护注意力和未来读者的判断时间。当组织仍把“交付一份完整文件”当作任务终点,AI就会成为世界上最高效的完成感制造机。
二、别急着宣布AI文档的信息密度已经大幅下降
“AI写得很长,读完没得到什么”,很多人都有这种感觉。但感觉不是行业结论。
目前的公开研究,还不足以证明所有AI生成的企业文档都出现了显著密度下降。更直接的证据集中在三个局部:有些输出可以无损压缩,自动评审会奖励长度,不同人的AI辅助作品更容易趋同。
“Verbosity = Veracity”把一种现象叫作verbosity compensation:模型已经被要求简洁回答,仍然生成重复、歧义或过度枚举的文字,而且这些部分可以在不损失信息的情况下被压缩。研究在5个知识与推理问答数据集、14个模型上观察到这种行为;在论文的定义下,GPT-4的发生频率为50.40%,Qasper上冗长回答与简洁回答的性能差距达到27.61个百分点。[2]
这是一篇预印本,任务是问答,不是企业长文。50.40%不能写成行业发生率。它真正提供的是一个可测量定义:一段文字如果删除后不损失任务信息,删除的部分就是低信息token。
长度为什么会稳定存在?Length-Controlled AlpacaEval给出了一条激励解释:LLM自动评审倾向偏好更长的输出。控制长度后,该评测与LMSYS Chatbot Arena的Spearman相关从0.94提高到0.98,也更难被单纯增加冗长度操纵。[3]
换句话说,模型可能在不确定时用长度补偿;评测又可能把长度误认成完整。两者叠加,很容易生产一种“每句话都没错,整篇却没有增加多少判断”的文档。
但反方同样成立。AI可以把凌乱会议记录压缩成清晰决策,把几十页法规抽成适用条款,把多人重复意见去重。高质量人机协作完全可能提高单篇密度。
所以,问题不能写成“AI文档一定更差”。更准确的判断是:
当事实预算、去重规则和可核验验收缺席时,AI更容易扩大文本分母,却不扩大独特信息分子。

图2|AI文本可以更流畅、更易检索,同时新增事实更少、来源更弱;四个变量必须分别验收。
三、真正先下降的,可能是整个知识库的独特信息密度
一份文档可以写得不错,整个知识库仍然越来越差。
ICLR 2024的一项受控实验招募38名Upwork写作者,让他们分别在无模型、GPT-3和InstructGPT三种条件下写议论文;每组收集100篇,覆盖10个题目。InstructGPT组的文章彼此更相似,词汇和关键观点多样性显著下降;GPT-3组与人类单独写作组没有显著差异。[4]
这点很关键:同质化不是所有模型、所有流程的宿命。它与模型如何对齐、如何给建议、用户如何采用建议有关。
Science Advances的随机实验又揭示了另一面。293名写作者获得0个、1个或最多5个GPT-4创意,600名独立评估者在不知道条件的情况下评估作品。AI辅助提高了个体故事的评价,尤其帮助了原本创造力较低的写作者;与此同时,AI辅助故事彼此更相似。[5]
个体质量提高,群体多样性下降。这两件事可以同时发生。
企业知识库也可能出现同样的结构。一份调研被生成周报、专题、PPT、管理层摘要和会议材料。每份都完整、清楚、能够单独转发,但它们大多来自同一批原始证据。文档数量增加十倍,独特事实没有增加十倍。
真正先下降的,可能不是单篇文档质量,而是整个知识库的独特信息密度。
如果组织默认把每个衍生版本都永久入库,三个问题会接连出现:重复主张挤占检索位置;源数据更新后,多个版本彼此冲突;少数真正新增的异常信号,被大量平均化表达包围。

图3|研究没有证明所有模型都导致同质化;ICLR实验中GPT-3组未见显著差异,InstructGPT组才出现下降。
四、最危险的悖论:二手文本可能更容易被AI找到
直觉上,没有增加多少事实的衍生文档,对AI也应该没什么价值。KDD 2024的实验给出了相反结果。
研究者以SciFact和NQ320K为基础,让Llama2和ChatGPT重写人类语料,构建人写文本与AI文本混合的检索基准。两个基准分别包含300个测试查询与5,183篇人写语料、7,830个测试查询与109,739篇人写语料,并配有对应的生成版本。实验发现,神经检索器倾向把LLM生成内容排在更高位置;偏置不只存在于第一阶段召回,也延伸到第二阶段重排器。[6]
作者把它叫作source bias。压缩和困惑度分析给出的机制是:LLM重写文本往往语义更集中、噪声更少,对预训练语言模型式检索器而言更容易理解和匹配。[6]
注意,“噪声更少”是机器视角,不是事实核验结论。原始材料里的限定语、异议、不规则措辞和现场背景,可能会降低匹配分,却恰好决定一条结论是否成立。
于是,一个危险循环出现了:
原始证据包含复杂语境和限定条件;
AI把它重写成更像标准答案的文本;
神经检索器更偏好这些衍生文本;
下一轮模型主要看到衍生文本,再生成新的摘要;
原始证据仍在库里,却在实际访问中越来越不可见。
对机器更容易匹配,不等于对组织更接近事实。
这项研究使用的是实验语料,不是十年企业知识库,也不能证明所有现代检索器都有相同偏置。它证明的是另一件事:语义相关性排序并不天然来源中立。若系统不显式提高原始证据、当前版本和权威来源的权重,AI生成内容可能凭借“更像AI”获得额外曝光。

图4|KDD 2024在两个混合语料基准上观察到来源偏置;实验语料不等于真实企业知识库。
五、向量是索引,不是事实本体
因此,“未来文档会变成向量数据库”是一个有传播力、但技术上不够准确的说法。
向量嵌入擅长建立语义的近似地址。它能告诉系统,这几个文本块与查询很像。它不能仅凭距离回答:哪一个是原始合同,哪一个是AI摘要;哪一个已经作废;哪一个只适用于某个市场;哪一个由负责人确认;当前Agent有没有权把它发给外部。
成熟的向量数据库当然可以附加元数据、关键词检索、权限过滤和重排。本文反对的不是向量技术,而是“把全部文件切块、嵌入,就等于建立了知识系统”的简化设计。
长上下文也没有自动解决问题。“Lost in the Middle”发现,相关信息放在长上下文的开头或结尾时,模型表现通常更好;放在中间时会明显下降。[7] 模型已经进步,但“窗口装得下”仍不等于“能够等权、稳定、可审计地使用”。
传统向量RAG还不擅长全局问题。GraphRAG论文指出,向量RAG适合答案局部存在于少量记录的问题,却难以回答“整个语料的主要主题是什么”这类跨语料问题。其图索引和社区摘要在约100万token的实验语料上提高了答案完整性与多样性。[8] 但图和摘要也是衍生层,不能替代原始证据。
向量是索引,不是事实本体。

图5|向量是重要索引;事实本体、来源、状态、权限和责任需要单独表示。
六、未来不是“把文档写给AI”
AI真正需要的,往往不是一份从背景写到结论的完整报告。它需要的是当前任务下最小而充分的上下文:目标、事实、约束、权限、工具、未知项和验证要求。
MCP 2025-06-18资源规范提供了一个信号。文件、数据库模式和应用信息可以作为资源被服务器暴露,每个资源由URI唯一标识,宿主应用按任务决定哪些资源进入上下文。[9] 重点不是把所有资源拼成一份长文,而是让它们可发现、可读取、可寻址。
Cloudflare的Markdown for Agents展示了另一种双视图:启用功能的网站在客户端请求Accept: text/markdown时,可以把同一源站HTML实时转换为Markdown。人类浏览器得到页面,机器客户端得到更适合处理的文本,权威来源仍是同一个对象。[10]
W3C的JSON-LD 1.1用于在JSON生态中表达链接数据,PROV-O用于描述实体、活动、代理及其来源关系。[11][12] 这些标准不能自动保证事实正确,却说明机器可读知识需要语义、关系和出处,而不只是更容易分词的长文本。
我认为,未来企业知识系统会形成五层:
原始证据层:合同、数据快照、政策原文、实验记录,不随意覆盖;
知识对象层:事实、主张、事件、指标、约束和决策,各有稳定ID;
关系与治理层:来源、作者、时间、范围、状态、权限和替代关系;
多索引层:关键词、向量、关系图、SQL和时间索引各司其职;
视图层:Agent获得任务上下文包,人类获得叙事文档,监管获得可冻结快照。
未来不是把文档写给AI,而是先把知识组织成可验证对象,再按人的需要生成文档。

图6|机器上下文与人类文档不是两个事实世界;它们应回到同一组可验证对象。
七、完整文档不会消失,它会变成“编译结果”
我不相信人类会停止阅读文档。
复杂决策需要共同叙事。合同、董事会决议、监管申报和审计报告需要固定版本、签署与责任。战略文章的价值,也不只是提供原子事实,而是判断哪些事实重要、因果链如何成立、什么反例足以推翻结论。
真正变化的是权威位置。
今天,很多组织默认事实“住在那份文档里”。未来,高价值文档更像软件的编译结果:它由哪些证据、知识对象、规则和版本生成,可以被回溯;底层事实更新后,系统知道旧文档是否过期;需要签署时,再冻结为正式版本。
人类文档负责语境、解释、承诺和共同理解。结构化事实与关系负责确定性。关键词、向量和图负责发现。权限、版本和来源负责治理。不同层不能互相冒充。
因此,十年后仍然值钱的完整文档,会比今天更少,也更贵。它们代表的是高强度判断和可追责承诺,而不是模型把格式补齐了。
最不值钱的,是另一类东西:没有新增事实,没有独立判断,没有责任所有者,没有有效期,却因为语言完整而被保存、转发和相信。
八、这项判断必须接受证伪
目前没有公开数据给出“企业AI文档信息密度下降了多少”。把一个有机制支持的判断写成已确认的全行业事实,只会制造另一份低密度文档。
真正的验证并不复杂。对同一任务、同一源材料和同一长度上限,比较人类独立写作、纯AI生成、人机协作三组结果;盲评并记录七项指标:独特主张密度、证据链接率、可无损压缩率、决策增量、跨文档重复率、原始来源召回率和权威命中率。
如果AI与人机协作版本持续提高每分钟独特可核验主张数,降低遗漏和冲突,同时让原始来源更容易被找回,那么“AI导致密度下降”的判断就应被缩小到特定模型、模板或管理流程。
如果向量优先系统能够在混合人写和AI衍生语料中,稳定优先返回最新、权威、可追溯的原始证据,而不需要额外来源和状态层,那么“纯向量方案不够”的判断也需要修改。

图7|若AI在七项指标上持续胜出,本文判断就应缩小到特定模型、模板或治理流程。
但在证据出现之前,企业至少可以改一条默认规则:AI生成完成,不等于知识新增。
只有新增证据、独立判断、正式决策或状态变化,才进入长期知识层。摘要、改写和临时汇报可以随时生成,也应允许过期和重建。
十年后的竞争,不是谁能生成更多完整文档,而是谁能让人和Agent都回到同一个可验证事实层。
完整文档不会消失。
失去价值的,是那些既不能增加事实,也不能回到事实,却因为形式完整而被当作知识的文档。
资料与口径
1. Anthropic,Anthropic Economic Index report: Cadences,2026-06-26数据章节覆盖2026-04-10至2026-06-10抽样会话;厂商自有遥测和分类器,不能外推到全行业。
2. Zhang、Das与Zhang,Verbosity = Veracity,arXiv:2411.07858v2,2024-12-07预印本,研究问答任务中的可无损压缩冗余,不代表企业文档发生率。
3. Dubois等,Length-Controlled AlpacaEval,arXiv:2404.04475研究LLM自动评审的长度偏好,不等于企业人工审阅。
4. Padmakumar与He,Does Writing with Language Models Reduce Content Diversity?,ICLR 2024英文议论文受控实验,模型和文类边界明确。
5. Doshi与Hauser,Generative artificial intelligence enhances creativity but reduces the diversity of novel content,Science Advances 10(28),2024短故事随机实验,不代表企业报告。
6. Dai等,Neural Retrievers are Biased Towards LLM-Generated Content,KDD 2024使用LLM重写的公开检索数据,证明来源偏置风险,不证明AI文本更真实。
7. Liu等,Lost in the Middle: How Language Models Use Long Contexts,arXiv:2307.03172v3模型代际已有变化,用于说明位置敏感机制。
8. Edge等,From Local to Global: A GraphRAG Approach to Query-Focused Summarization,arXiv:2404.16130v2预印本,含LLM评审和无唯一标准答案的限制。
9. Model Context Protocol,Resources,Specification 2025-06-18协议能力不等于企业采用率。
10. Cloudflare,Markdown for Agents2026-08-16回读时为Beta;作为双视图实现信号,不作为采用率证据。
11. W3C,JSON-LD 1.1,Recommendation,2020-07-16标准存在不等于企业实施成熟。
12. W3C,PROV-O: The PROV Ontology,Recommendation,2013-04-30来源本体不能自动保证事实正确。
公开证据支持部分模型的可无损压缩冗余、自动评审的长度偏好、跨作品内容趋同及神经检索来源偏置;尚不足以证明所有企业AI文档的单篇信息密度都已大幅下降。标题中的“不值钱”指仅有完整外观、不能证明来源与状态的文档,不包括合同、监管、董事会和责任冻结所需的正式快照。
Result is everything.
王冉,跃盟科技创始人。
夜雨聆风