乐于分享
好东西不私藏

AI生成的内容就应该被歧视吗?书商为何把“没有混入AI生成内容”包装成质量标签

AI生成的内容就应该被歧视吗?书商为何把“没有混入AI生成内容”包装成质量标签
404 Media报道,图书数据服务商ISBNdb在向AI企业推销纸质出版物过程中强调:

书籍经过筛选和编辑,具有完整结构、专业知识和较高的信息密度,是普通网页抓取难以替代的训练数据;与此同时,这些前大模型时代出版的书籍,还可以确保没有混入近年来批量出现的AI生成内容。

这段营销话术听起来很有说服力。
经过编辑、结构完整、知识密度较高,确实可能构成纸质出版物的优势。
但最后一个理由却需要单独讨论:
没有混入AI生成内容,为什么就能被包装成一种质量标签?
这背后隐含着一个越来越常见的判断:人类创作的内容更加真实、纯净和可靠,而AI生成的内容天然属于低质量污染物。
但这个判断真的成立吗?

一、这是书商的营销,不是AI公司的判断

首先必须澄清,这则新闻并不能证明AI公司已经形成了统一的数据采购标准,更不能证明AI企业正在集体抢购所谓“纯人类内容”。
公开材料能够确认的是:

ISBNdb正在向AI企业推销大批量实体图书采购服务,并主动把“没有AI生成内容”作为卖点。

这是供应商对自身产品价值的定义,是一种销售策略。
它可能回应了AI企业对于训练数据来源的某些担忧,但不能反过来证明,所有AI公司都认为“AI生成内容没有训练价值”。
在商业营销中,卖方往往会寻找最容易被客户理解的差异化标签。
纸质书的真实优势比较复杂,包括内容结构、专业编辑、版权来源、出版年代、知识覆盖和网页中难以获取的长尾信息。
相比之下,“没有AI污染”非常简单,也更容易形成传播。
于是,一个复杂的训练数据质量问题,被压缩成了一个二元对立:

人类内容是干净的,AI内容是被污染的。

这只是一种营销话术,而不是经过证明的数据科学结论。

二、“没有AI生成内容”只说明来源,不说明质量

一段内容是否由AI生成,属于它的来源特征。
一段内容是否准确、有价值、适合训练,则属于它的质量特征。
两者并不能直接画等号。
一本出版于2020年的书,当然大概率不会包含当前大语言模型批量生成的文字。但这只能说明它产生于前大模型时代,不能证明书中的内容一定正确。
人类写作同样可能存在很多问题:事实错误、知识过时、逻辑混乱、观点偏见、低水平重复,甚至抄袭、伪造和刻意误导。
出版流程能够降低部分风险,却不能消除所有风险。一本书经过编辑出版,也不意味着其中的每一个判断都准确,更不意味着它天然代表高质量的训练数据。
因此,“没有混入AI生成内容”最多是一种数据来源说明,不能直接成为数据质量认证。
就像“纯手工制作”不一定代表产品性能更好,“人类创作”也不能自动代表内容更优质。

三、旧书有价值,但不能把所有价值都归因于“不是AI写的”

前大模型时代的纸质出版物确实可能具有重要的训练价值。
首先,书籍通常具有较完整的结构。
网页内容往往围绕搜索、点击和即时传播组织,信息较为零散。一本书则可能围绕一个问题展开连续论证,提供从概念、背景到分析和结论的完整知识结构。
其次,专业出版物可能包含互联网上难以找到的知识。
地方史料、绝版教材、专业手册、小众研究、旧行业资料和非英语出版物,都可能补充公开网页数据无法覆盖的长尾内容。
再次,书籍通常经过作者、编辑和出版机构的多重加工。
虽然这不能保证内容一定正确,但能够在一定程度上减少语句残缺、结构混乱和无意义重复。
这些都是纸质出版物可能成为优质训练数据的合理理由。
但它们与“没有AI生成内容”不是同一件事。
一本书有价值,可能因为它经过专业编辑,知识结构完整,记录了稀缺信息,或者代表了某一历史时期的真实语言和思想。
不能把这些具体优势全部归结为因为它不是AI写的,所以它更好。
这样做,实际上是用内容的“血统”替代对内容本身的评价。

四、如果AI生成内容天然低质,知识蒸馏又是在做什么

“AI生成内容天然不适合训练AI”这一判断,还有一个非常明显的反例:
知识蒸馏
所谓知识蒸馏,简单来说,就是让能力较弱的模型学习能力更强模型的输出。
Anthropic对蒸馏的解释非常明确:较弱模型可以通过学习强模型的回答获得部分能力,前沿AI实验室也会使用自己的强模型训练更小、更便宜的模型。Anthropic将其称为一种广泛使用、具有正当用途的训练方法。
这些训练材料是谁生成的?正是AI。
微软研究团队训练Phi-1时,除了筛选网络中的“教材质量”数据,还使用GPT-3.5生成了约10亿个词元的合成教材和编程练习。研究者认为,清晰、完整并围绕训练目标设计的数据,可以显著提高模型的学习效率。
DeepSeek-R1也把大模型形成的推理能力蒸馏到基于Qwen和Llama的小模型中。相关论文显示,直接学习DeepSeek-R1输出的推理模式,可以明显增强小模型的推理能力。
这说明,AI生成内容不仅可以成为训练数据,还可以成为专门设计的高密度教学数据。
问题不在于它是不是AI生成的,而在于:
  • 由什么能力水平的模型生成;
  • 围绕什么目标生成;
  • 是否经过筛选;
  • 是否可以验证;
  • 是否包含错误;
  • 是否真正改善模型能力。
低成本批量生产、未经检查的AI文章,可能是垃圾。
而针对明确任务生成、经过验证和筛选的合成数据,也可能比大量自然文本更适合训练。
它们都叫“AI生成内容”,但质量完全不同。

五、反对AI垃圾,不等于否定AI生成内容

现在互联网上确实出现了大量低质量AI内容。
有人利用生成工具批量制作文章、图片、视频和书籍,不进行核查,也不承担编辑责任。生产成本大幅下降以后,低质量内容可以以前所未有的规模进入搜索引擎、社交平台和内容市场。
“AI slop”这个词,正是在这种背景下流行起来的。
它指向了一个真实问题:

AI降低了内容生产成本,却没有建立相应的质量控制机制。

但从“互联网上出现大量低质量AI内容”,不能直接推出“AI生成的内容都是低质量的”。
对于人类创作,我们不会因为网络上存在谣言、营销软文和洗稿文章,就认定所有人类写作都是垃圾。
同样地,也不能因为大量AI内容未经核查,就对所有AI生成内容作出预先判决。
这里所说的“歧视”,并不是说AI拥有与人类相同的权利,而是指一种来源偏见

在尚未检查内容之前,仅仅因为它由AI生成,就预先认定它低质、虚假或者没有价值。

这与正常的风险管理不同。由于AI可能出现幻觉、批量复制错误,AI生成内容当然应该接受核查。但核查的目的,是判断它是否准确,而不是确认它“是不是AI写的”。

六、真正的数据质量标准更复杂

评价训练数据,至少要回答几个更实质的问题。
  • 内容是否准确,决定模型会不会学习错误知识。
  • 内容是否包含新信息,决定它是在扩展模型的知识边界,还是重复模型已经知道的东西。
  • 内容是否符合训练目标,决定它对于当前任务是否有效。
  • 内容是否经过验证,决定其中的事实、计算、代码和推理能否被信任。
  • 内容是否保持多样性,决定模型能否覆盖不同观点、语言、文化和长尾情况。
  • 内容是否具有合法来源,则决定这套训练体系能否持续运行。
这些标准都比“由谁生成”更加重要。
一段由人类随意拼凑的错误文字,不会因为作者是人类,就成为优质数据。
一段由AI生成、经过程序验证的代码,也不会因为作者是AI,就失去价值。
更合理的判断应该是:

人类数据和AI数据都需要筛选,只是它们可能具有不同的风险结构。

人类内容可能携带历史偏见、事实错误和陈旧知识;AI内容可能复制模型幻觉、缩小表达多样性,并放大已有偏差。
需要根据具体风险建立不同的控制方法,而不是给其中一类内容贴上永久的质量标签。

七、“没有AI内容”为什么会成为一个好卖点

因为它同时迎合了两种焦虑。
第一种是AI行业对原始数据的焦虑。
随着AI生成内容大量进入互联网,训练者越来越难以判断一段网页究竟来自真实的人类表达,还是由旧模型批量生成。能够明确确定年代和来源的数据,因此具有新的稀缺性。
第二种是公众对AI内容的焦虑。
越来越多人遭遇过AI幻觉、低质量自动文章和批量生成的图片。“没有AI生成内容”很容易让人联想到真实、纯净、可靠和未经污染。
书商把这两种焦虑结合在一起,就产生了一个非常有传播力的卖点:

这里保存着AI出现以前的人类知识。

这个卖点当然能够帮助解释旧书为什么稀缺,却也悄悄完成了一次价值偷换:

从“这些数据来自模型之外”,变成“这些数据一定比模型生成的数据更好”。

前一个判断可能成立。
后一个判断并没有得到证明。

结语

AI生成内容带来的信息污染是真实问题。
未经核查的自动生成内容,正在增加搜索、出版、学术和公共传播的质量控制成本。我们当然不能因为AI提高了生产效率,就降低内容责任标准。
但解决这一问题的方法,不应该是把“人类创作”变成质量认证,把“AI生成”变成质量污点。
ISBNdb把“没有混入AI生成内容”作为旧书的卖点,是一种容易理解的商业表达。
真正的数据质量判断,却不能停留在这里。

没有AI生成内容,只能证明数据来自模型之外,不能证明数据本身更加准确。

反过来:

由AI生成,也只能说明内容的生产方式,不能直接证明内容没有价值。

人类创作不天然等于优质,AI生成也不天然等于垃圾。
当我们开始用内容来源代替内容评价时,看似是在抵制AI污染,实际上只是用一种更简单的偏见,回避了更困难的质量判断。
真正应该被拒绝的,从来不是AI生成的内容。
而是那些无论由人还是由AI生产,都未经验证、缺乏价值、没有责任主体的内容。

参考资料
  1. 404 Media:AI Companies Are Buying Tons of Old Books Because They're Free of AI Slop,2026年7月21日。
  2. Anthropic:Detecting and Preventing Distillation Attacks,2026年2月23日。
  3. Microsoft Research:Textbooks Are All You Need,2023年。
  4. DeepSeek:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,2025年。
  5. Nature:AI Models Collapse When Trained on Recursively Generated Data,2024年。