AI 检测分数最多只能告诉你“这里值得再看一眼”。一旦让它直接决定谁作弊、谁原创,概率就被偷偷换成了判决。
绞尽脑汁写完一篇文章,丢进检测工具,结果跳出来:80% AI 生成。
那一刻真的比窦娥还冤。
明明是自己一个字一个字敲的,为什么机器比我更确定“这不是我写的”?这东西到底靠不靠谱?
先给结论:
当线索可以,当辅助证据要谨慎,当判决就是冤案制造机。
● ● ●
一、先看几个离谱结果:名著都过不了
2025 年 5 月,新华网客户端转发的一篇报道提到,有人把经典作品的片段送进某常用论文检测系统:
- 朱自清《荷塘月色》片段:AI 生成疑似度 62.88%
- 刘慈欣《流浪地球》片段:52.88%
- 王勃《滕王阁序》:接近 100%
按这套结果,朱自清涉嫌使用 AI,王勃直接毕不了业。
这当然不能证明“所有检测器都没用”。测试没有公布完整文本、系统版本和参数,也不是一场严格的学术评测。
但它至少证明了一件事:一个很高的分数,完全可能落在确定由人写成的文字上。
还有学生发现,论文里的学院、班级、学号、姓名,也会被标成疑似 AI 生成。原因不神秘:这类文字格式固定、用词可预测,恰好像检测器眼里的“机器语言”。
检测器看到的是统计特征,不是王勃,也不是你。

小土拿着接近100%的检测单,重新核对确定由古人写下的名篇
● ● ●
二、别急着拿“98% 准确率”替它撑腰
很多争论一到这里,就会有人搬出厂商数据:准确率很高,误判率不到 1%。
问题是,准确率、误判率、召回率和“这一次有没有冤枉我”,不是同一个数字。
以 Turnitin 为例,它公开称,在“检测结果超过 20%”的长文档范围内,文档级误判率约为 1%。但它自己的最新使用说明同时写得很清楚:
- 0% 到 19% 的区间更容易出现误判,因此现在不再展示精确百分比;
- 模型可能把人写的、AI 写的和 AI 改写的文本认错;
- 不能仅凭这个分数,对学生采取不利措施。
这三句话比广告页上的准确率更重要。
再看另一头。OpenAI 曾经推出过自己的文本分类器。它在测试集里只识别出 26% 的 AI 文本,却把 9% 的人类文本判成 AI。2023 年 7 月,OpenAI 因“准确率太低”下架了这个工具。
同年,一项覆盖 14 种检测工具的独立研究也得出了不乐观的结论:当时的工具整体还不足以稳定区分人写和 AI 写,文本经过翻译或改写后,表现会继续下降。
我也不想假装技术永远停在 2023 年。到了 2026 年,确实有新工具在特定数据集上做得更好。但“某项测试表现不错”,和“可以拿来给一个具体的人定罪”,中间还隔着语言、文体、长度、模型版本和人工修改。
检测器有进步,不等于它已经有了判案资格。
● ● ●
三、同一篇论文,换个平台能差十倍
真正暴露问题的,不只是单个平台会误判,而是平台之间经常互相打架。
央视网转载的 2025 年毕业季调查里,一名学生把同一篇课程论文交给不同系统检测,一个显示 AIGC 率 70%,另一个显示 7%。
同一篇文章。差十倍。
如果前一个平台是学校采购的,她可能要重写;如果后一个平台是学校采购的,什么事都没有。
这不是“哪个平台更严格”一句话能解释的。不同工具的训练数据、特征、阈值和支持语言都不一样,输出的百分比也未必表示同一种概率。
三个裁判可以意见不同。但如果裁判连规则、尺度和比分含义都不一样,就不能只看大屏幕上的那个数字。
你以为自己拿到的是体温计,实际更像三个口径不同的天气预报。

小土把同一篇论文放上两台检测器,一边70%,一边7%
● ● ●
四、它为什么会冤枉认真的人,又放过会改的人?
很多文本检测器会看一类统计特征:词语是否可预测,句子是否过于平稳,结构是否规整,语言是否缺少意外。
简单说,就是找“AI 味”。
问题也正出在这里。
认真修改的文章、规范的学术文字、固定格式的材料,本来就会更整齐。它们可能和机器生成文本落在相似的统计区域。
非母语写作者受伤尤其明显。斯坦福研究团队测试了 7 种检测器;在他们使用的 TOEFL 作文样本中,非英语母语学生写下的真人作文,平均有 61.22% 被判成 AI 生成。91 篇作文里,89 篇至少被一个工具标记过。斯坦福 HAI 的研究说明给出的解释是,非母语写作者往往使用更稳妥、更容易预测的词汇和句法,而检测器常把这种“可预测”当成 AI 信号。
这对中国学生不是边角问题,是正面撞上。
反过来,真的用了 AI 的人,只要让模型换一种文风、翻译一次,再自己改几遍,很多特征就会被冲淡。OpenAI 当年的说明和斯坦福研究都明确提到了这种规避。
于是出现一个很尴尬的局面:
写得认真、写得标准的人可能被误伤;会绕检测的人,反而更容易过去。
● ● ●
五、最危险的不是判不准,是分数被接上了硬红线
单纯测不准,还只是一个不好用的工具。
测不准的百分比一旦接上“不能答辩”“必须重写”“取消评优”,问题就变了。
国内高校已经陆续把 AIGC 检测放进论文管理,但规则并不统一。比如,四川大学 2025 年通知给出的原则线是文科不超过 20%、理工医科不超过 15%;有的院校把 15% 用在评优,有的把 30% 或 40% 作为整改、警示或答辩门槛。
这里最值得警惕的,不是哪一条线更合理,而是:
工具口径不一致,学校红线也不一致,最后承担后果的却是学生。
检测生意还会自然长出另一门生意——“降 AI 率”。
把句子改得生硬一点,故意打乱结构,塞进口语和错别字,就可能让分数下降。新华社那篇报道已经记录了这种现象:有人删掉精彩段落,有人花钱“代降”,还有人把本来清楚的文章改得不好好说话。
一个本来要保护原创的机制,最后开始奖励难读。
这事挺荒诞。
美国也有相似剧本。NPR 在 2025 年报道过一名 17 岁高中生 Ailsa Ostovitz:她一篇写自己喜欢的音乐的作业,被检测工具打出 30.76%,随后遭到老师质疑。她需要花额外时间反复解释、检查和修改那些本来就是自己写的文字。
工具判错几乎没有成本。被判错的人,却要证明一件极难证明的事——“这段话确实是我自己想出来的”。
● ● ●
六、那到底该怎么用?
给两类人各留一条实在的。
如果你是老师、老板或编辑:
把分数当作“开始核查的理由”,不要当作“结束讨论的判决”。
分数高,可以找本人聊五分钟:为什么这样组织?这条资料从哪里来?这一段删掉会影响什么?真正理解内容的人,通常能解释选择、补充细节,也能面对追问。
再看过程证据:提纲、资料来源、早期草稿、版本历史、批注和修改轨迹。单独一项都不是铁证,放在一起却比一个百分比更接近事实。
如果你可能被误判:
尽量在带版本历史的工具里写作,并保留提纲、检索记录、参考资料、草稿和重要修改。不要只留下最后那个过分干净的成品。
这些材料不能保证“一秒自证”,但能让你拿出一条可信的写作过程,而不是和一个黑箱分数空口对打。

小土把检测分数放回线索位置,再用版本历史和当面追问完成判断
我最后的态度没变:
AI 检测器可以提示“这里值得看一眼”,但不能替人回答“这个人有没有作弊”。
线索归线索。判决归判决。
夜雨聆风