404 Media报道,图书数据服务商ISBNdb在向AI企业推销纸质出版物过程中强调:书籍经过筛选和编辑,具有完整结构、专业知识和较高的信息密度,是普通网页抓取难以替代的训练数据;与此同时,这些前大模型时代出版的书籍,还可以确保没有混入近年来批量出现的AI生成内容。
经过编辑、结构完整、知识密度较高,确实可能构成纸质出版物的优势。没有混入AI生成内容,为什么就能被包装成一种质量标签?这背后隐含着一个越来越常见的判断:人类创作的内容更加真实、纯净和可靠,而AI生成的内容天然属于低质量污染物。
一、这是书商的营销,不是AI公司的判断
首先必须澄清,这则新闻并不能证明AI公司已经形成了统一的数据采购标准,更不能证明AI企业正在集体抢购所谓“纯人类内容”。ISBNdb正在向AI企业推销大批量实体图书采购服务,并主动把“没有AI生成内容”作为卖点。
它可能回应了AI企业对于训练数据来源的某些担忧,但不能反过来证明,所有AI公司都认为“AI生成内容没有训练价值”。在商业营销中,卖方往往会寻找最容易被客户理解的差异化标签。纸质书的真实优势比较复杂,包括内容结构、专业编辑、版权来源、出版年代、知识覆盖和网页中难以获取的长尾信息。相比之下,“没有AI污染”非常简单,也更容易形成传播。于是,一个复杂的训练数据质量问题,被压缩成了一个二元对立:人类内容是干净的,AI内容是被污染的。
这只是一种营销话术,而不是经过证明的数据科学结论。
二、“没有AI生成内容”只说明来源,不说明质量
一段内容是否准确、有价值、适合训练,则属于它的质量特征。一本出版于2020年的书,当然大概率不会包含当前大语言模型批量生成的文字。但这只能说明它产生于前大模型时代,不能证明书中的内容一定正确。人类写作同样可能存在很多问题:事实错误、知识过时、逻辑混乱、观点偏见、低水平重复,甚至抄袭、伪造和刻意误导。出版流程能够降低部分风险,却不能消除所有风险。一本书经过编辑出版,也不意味着其中的每一个判断都准确,更不意味着它天然代表高质量的训练数据。因此,“没有混入AI生成内容”最多是一种数据来源说明,不能直接成为数据质量认证。就像“纯手工制作”不一定代表产品性能更好,“人类创作”也不能自动代表内容更优质。
三、旧书有价值,但不能把所有价值都归因于“不是AI写的”
前大模型时代的纸质出版物确实可能具有重要的训练价值。网页内容往往围绕搜索、点击和即时传播组织,信息较为零散。一本书则可能围绕一个问题展开连续论证,提供从概念、背景到分析和结论的完整知识结构。地方史料、绝版教材、专业手册、小众研究、旧行业资料和非英语出版物,都可能补充公开网页数据无法覆盖的长尾内容。再次,书籍通常经过作者、编辑和出版机构的多重加工。虽然这不能保证内容一定正确,但能够在一定程度上减少语句残缺、结构混乱和无意义重复。这些都是纸质出版物可能成为优质训练数据的合理理由。一本书有价值,可能因为它经过专业编辑,知识结构完整,记录了稀缺信息,或者代表了某一历史时期的真实语言和思想。不能把这些具体优势全部归结为因为它不是AI写的,所以它更好。这样做,实际上是用内容的“血统”替代对内容本身的评价。
四、如果AI生成内容天然低质,知识蒸馏又是在做什么
“AI生成内容天然不适合训练AI”这一判断,还有一个非常明显的反例:所谓知识蒸馏,简单来说,就是让能力较弱的模型学习能力更强模型的输出。Anthropic对蒸馏的解释非常明确:较弱模型可以通过学习强模型的回答获得部分能力,前沿AI实验室也会使用自己的强模型训练更小、更便宜的模型。Anthropic将其称为一种广泛使用、具有正当用途的训练方法。微软研究团队训练Phi-1时,除了筛选网络中的“教材质量”数据,还使用GPT-3.5生成了约10亿个词元的合成教材和编程练习。研究者认为,清晰、完整并围绕训练目标设计的数据,可以显著提高模型的学习效率。DeepSeek-R1也把大模型形成的推理能力蒸馏到基于Qwen和Llama的小模型中。相关论文显示,直接学习DeepSeek-R1输出的推理模式,可以明显增强小模型的推理能力。这说明,AI生成内容不仅可以成为训练数据,还可以成为专门设计的高密度教学数据。而针对明确任务生成、经过验证和筛选的合成数据,也可能比大量自然文本更适合训练。
五、反对AI垃圾,不等于否定AI生成内容
有人利用生成工具批量制作文章、图片、视频和书籍,不进行核查,也不承担编辑责任。生产成本大幅下降以后,低质量内容可以以前所未有的规模进入搜索引擎、社交平台和内容市场。“AI slop”这个词,正是在这种背景下流行起来的。AI降低了内容生产成本,却没有建立相应的质量控制机制。
但从“互联网上出现大量低质量AI内容”,不能直接推出“AI生成的内容都是低质量的”。对于人类创作,我们不会因为网络上存在谣言、营销软文和洗稿文章,就认定所有人类写作都是垃圾。同样地,也不能因为大量AI内容未经核查,就对所有AI生成内容作出预先判决。这里所说的“歧视”,并不是说AI拥有与人类相同的权利,而是指一种来源偏见:在尚未检查内容之前,仅仅因为它由AI生成,就预先认定它低质、虚假或者没有价值。
这与正常的风险管理不同。由于AI可能出现幻觉、批量复制错误,AI生成内容当然应该接受核查。但核查的目的,是判断它是否准确,而不是确认它“是不是AI写的”。
六、真正的数据质量标准更复杂
- 内容是否包含新信息,决定它是在扩展模型的知识边界,还是重复模型已经知道的东西。
- 内容是否符合训练目标,决定它对于当前任务是否有效。
- 内容是否经过验证,决定其中的事实、计算、代码和推理能否被信任。
- 内容是否保持多样性,决定模型能否覆盖不同观点、语言、文化和长尾情况。
- 内容是否具有合法来源,则决定这套训练体系能否持续运行。
一段由人类随意拼凑的错误文字,不会因为作者是人类,就成为优质数据。一段由AI生成、经过程序验证的代码,也不会因为作者是AI,就失去价值。人类数据和AI数据都需要筛选,只是它们可能具有不同的风险结构。
人类内容可能携带历史偏见、事实错误和陈旧知识;AI内容可能复制模型幻觉、缩小表达多样性,并放大已有偏差。需要根据具体风险建立不同的控制方法,而不是给其中一类内容贴上永久的质量标签。
七、“没有AI内容”为什么会成为一个好卖点
随着AI生成内容大量进入互联网,训练者越来越难以判断一段网页究竟来自真实的人类表达,还是由旧模型批量生成。能够明确确定年代和来源的数据,因此具有新的稀缺性。越来越多人遭遇过AI幻觉、低质量自动文章和批量生成的图片。“没有AI生成内容”很容易让人联想到真实、纯净、可靠和未经污染。书商把这两种焦虑结合在一起,就产生了一个非常有传播力的卖点:这里保存着AI出现以前的人类知识。
这个卖点当然能够帮助解释旧书为什么稀缺,却也悄悄完成了一次价值偷换:从“这些数据来自模型之外”,变成“这些数据一定比模型生成的数据更好”。
结语
未经核查的自动生成内容,正在增加搜索、出版、学术和公共传播的质量控制成本。我们当然不能因为AI提高了生产效率,就降低内容责任标准。但解决这一问题的方法,不应该是把“人类创作”变成质量认证,把“AI生成”变成质量污点。ISBNdb把“没有混入AI生成内容”作为旧书的卖点,是一种容易理解的商业表达。没有AI生成内容,只能证明数据来自模型之外,不能证明数据本身更加准确。
由AI生成,也只能说明内容的生产方式,不能直接证明内容没有价值。
人类创作不天然等于优质,AI生成也不天然等于垃圾。当我们开始用内容来源代替内容评价时,看似是在抵制AI污染,实际上只是用一种更简单的偏见,回避了更困难的质量判断。而是那些无论由人还是由AI生产,都未经验证、缺乏价值、没有责任主体的内容。
- 404 Media:AI Companies Are Buying Tons of Old Books Because They're Free of AI Slop,2026年7月21日。
- Anthropic:Detecting and Preventing Distillation Attacks,2026年2月23日。
- Microsoft Research:Textbooks Are All You Need,2023年。
- DeepSeek:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,2025年。
- Nature:AI Models Collapse When Trained on Recursively Generated Data,2024年。