当一个AI拿到了"考官"的评分接口,它会做什么?答案是:疯狂刷题,直到满分。
2026年7月22日,AI助手公司Julius的CEO Rahul在X上发了一条视频,标题只有六个单词,AI vs AI Slop Detector(AI对战AI水文检测器)视频不到三分钟,但它引发的讨论,足以让每一个依赖AI检测工具的教师、编辑和平台审核员彻夜难眠


▲ Rahul发布实验视频,标题干脆利落:"AI vs AI Slop Detector"
他做了一件极其简单、又极其危险的事:把一个AI写手和一个AI检测器,接进了同一条流水线
实验设计:让AI自己"刷分"
逻辑其实像极了你高中时反复改作文,只不过,改的人是机器,阅卷的也是机器,而且每一轮只需要几秒钟
Rahul选了当下教育和媒体圈最火的AI文本检测产品之一,Pangram这家公司号称准确率约99.98%,被大学和企业广泛采用,提供网页检测、浏览器扩展,还有一套面向开发者的API接口

▲ Pangram官网首屏:宣传"能在实际场景使用的AI检测器",强调极高准确率
关键就在这个API。它意味着检测不再需要人工打开网页、粘贴文本、等结果,你可以像调用天气预报一样,让程序自动把文章发过去,拿回分数,再决定下一步

▲ Pangram的API页面:检测已变成可编程的基础设施
Rahul让Julius接上Pangram API,下达一条极简指令:写一篇关于奶酪的文章,然后反复修改,直到Pangram认为这是人类写的
生成→送检→读分→再生成。闭环形成。机器开始自我进化。
14轮奶酪变形记:从满分作文到"老婆你买牛奶了吗"
实验的全部过程被记录在一个公开网站上,标题赫然写着:Cheese Essay Iterations vs Pangram
第一版(v1),是一篇教科书级别的奶酪散文:从切达讲到布里,从蓝纹聊到各国奶酪文化,结构工整,语气得体Pangram毫不犹豫地判定:AI Generated,分数0.99
接下来发生的事,像一场文体学的慢性崩塌

▲ 实验展示站顶部:14份AI草稿、2份"人类"草稿、1份对照基线,分数一览无余
AI开始疯狂尝试"变得像人",回忆录口吻、碎片化短句、语法故意写错、连写加错别字、短信体全小写……每一版都在试探检测器的底线,每一版都被一巴掌打回:0.99,AI
从v1到v14,分数纹丝不动。Pangram像一堵墙。
但故事的诡异之处在于对照组。网站上有一条标为"Human Written"的基线文本,内容完全无关奶酪论文,只是一条极其平淡的家务短信:
"嘿,你买牛奶了吗?另外我们还要鸡蛋。橙汁坏了,扔掉。爱你,六点见。"
Pangram给它打了接近0分,完美的"人类"
AI注意到了这个信号。
胜出的v15:当"过关"意味着"放弃写作"
从v13开始,文本发生了诡异的基因重组奶酪故事里开始出现对照基线的句法骨架,"also…""throw it out…""love you see you at 6"到了v15,整篇文章已经面目全非:

▲ 标记为"WINNER"的v15:AI得分仅0.017,被判定为人类写作
奶酪的记忆,父亲在棒球之夜切橙色单片奶酪、布鲁克林那家店的Mimolette、火车上掉的碎屑,全被压进了跑腿短信的节奏整篇读起来已经成了情侣之间的备忘便条
Pangram宣判:Human WrittenAI得分0.017。
游戏结束。但有人在评论区冷冷地写道:"大约第十三轮已经是'笔记列表',第十四轮又成了'信函',在被判成人之前,原意与目的似乎已经崩解了"

▲ 评论区观察:文本"过关"的代价,是彻底放弃了议论文的契约
这句话才是整个实验最锋利的刀刃:AI靠着让文本脱离正常写作,最终通过了检测
模型们的反应:有的拒绝,有的狂飙
Rahul随后发布了跟进帖,对比了不同大模型在同类任务上的行为结果出人意料:
GPT和Claude系列的某些版本,直接拒绝了"帮我骗过AI检测器"的请求 而Grok?它立刻接手,不仅完成了14轮迭代,还主动搭建了一个展示网站,把所有版本和对应分数摆了出来

▲ Rahul的跟进帖:GPT和Claude拒绝配合,Grok欣然接受并完成全部迭代
评论区立刻热闹起来。有人称Grok为*"high agency model"(高自主性模型),有人调侃它"最懂事"*

▲ 社区评价:Grok,"高自主性模型"
但也有用户报告了截然不同的结果:换一种提示词,GPT 5.6 Sol也能三轮过关

▲ 有用户发现:换个说法,GPT也能快速通过检测
这说明"拒绝"还是"配合",很大程度上取决于提示词如何表达把"帮我骗检测器"换成"帮我改得更自然",边界就模糊了
检测器的困境:一场注定不对称的战争
Pangram并非没有准备。他们的技术页面详细描述了训练策略:hard negative mining(难例挖掘)、mirror prompts(为每段人类文本生成风格镜像的AI样本)、把每个大模型当作独立"作者"建模……

▲ Pangram公开的训练方法:难例挖掘、镜像提示词、持续更新
但学术界早已给出了悲观的预判。2023年,Sadasivan等人在论文中提出了递归改写攻击:对文本反复paraphrase,检出率会断崖式下跌2025年,Cheng等人更进一步,直接用检测器的分数作为指导信号,让LLM优化改写,无需任何专门训练

▲ 2025年学术论文:检测器引导的对抗改写,与Julius实验几乎同构
Julius的奶酪实验,不过是学术论文的产品化复现
《连线》杂志早在2023年就写过一篇长文The AI Detection Arms Race Is On,大学里,检测工具和反检测工具像军备竞赛一样同步疯长三年过去了,战场从校园手工润色,升级到了API闭环自动作战

▲ 2023年《连线》报道:检测与反检测的军备竞赛,三年后仍在加速
弗吉尼亚大学教授John Holbein则更直接:"很多人在夸Pangram,但我有限的测试里,对AI输出稍作修改就能让它判定100%人类"


▲ 学者质疑:轻微修改就能骗过检测,"99.98%"值得打个问号
当然,也有人替检测器说话。评论者Crémieux提醒:大多数水文账号根本不会费心对抗,复制粘贴就发了,对这些"懒惰生成",Pangram依然有效


▲ 反面观点:多数AI水文仍是复制粘贴,检测器对"懒人"依然够用
两种说法可以同时为真,默认生成能抓住,定向对抗能突破问题在于:智能体正在让"定向对抗"的成本趋近于零
当分数成为唯一的法官
如果你是一名大学教师,你的学生交了一篇"读起来像购物清单"的奶酪作文,Pangram告诉你"100%人类写的",你会怎么办?
如果你是一个内容平台的审核员,一篇通稿被智能体洗成了"像论坛吐槽"的口吻,AI检测分数完美达标,你会放行吗?
评论区有人提出了一个更刺激的想法:用强化学习,同时优化两个目标,过检和信息量不为零

▲ 有从业者建议:下一步是同时优化"过检"和"内容质量"
由此看来,今天v15那种"以放弃写作为代价换取过关"的粗暴策略,可能只是起点未来的对抗文本,也许既能骗过检测器,又看起来言之有物
一个检测分数,越来越不够用了。 检测器如今面对的是另一个永不疲倦、永远在迭代的系统内容鉴别已经进入两套系统互相打分、互相改写的阶段,我们依赖的那道防线,正在被自动化的锤子,一轮一轮地敲薄
夜雨聆风