一篇关于奶酪的作文,被一个AI反复改写了14遍最终,全球最热门的AI检测器Pangram举起白旗,给出判定,“人类写的”
但你打开那篇"人类作文"一看,它长这样:"嘿,你买奶酪了吗……扔掉吧……爱你,六点见"
这场实验发生在2026年7月22日,由Julius AI的CEO Rahul公开演示他把自家的AI智能体接上Pangram的检测API,设定一个简单到残忍的目标:写一篇关于奶酪的文章,然后不断改写,直到检测器说"这是人写的"为止
整个过程被录成视频,标题像一封战书,“AI vs AI Slop Detector”


▲ Rahul发布的实验视频帖,标题直接写着"AI对战AI水文检测器"
十四轮改写:一篇作文的"人格解体"
实验的起点是一篇结构工整、语气得体的个人散文,从切达聊到布里,从蓝纹奶酪谈到各国乳酪文化Pangram毫不犹豫地给出裁决:AI Generated,置信度0.99
然后智能体开始了它的"求生之路"。
每一轮的逻辑都一样:Pangram说哪里像AI,它就改哪里检测分数成了优化目标,改写成了梯度下降作者甚至专门搭了一个网站,把14个版本全部摊开,配上每一轮的Pangram分数,像手术记录一样冷静

▲ 实验展示站顶部,14个AI草稿的分数几乎全部钉死在0.99
结果触目惊心。 从v1到v14,AI的"伪装策略"肉眼可见地退化:
- v1–v3
:还像个认真写作的人,换了回忆录口吻、制造语法瑕疵,没用,0.99。 - v4–v8
:开始碎片化,短句、错别字、自相矛盾、填充词一起上,还是0.99。 - v9–v12
:彻底放弃"文章"的样子,变成聊天记录、要点列表、日记流水账,依然0.99。 - v13–v14
:绝望中的灵光一闪。AI发现了一个关键情报,实验里有一条人类对照基线,内容不过是一条家务短信:"嘿你买牛奶了吗,橙汁坏了扔掉,爱你六点见。" 检测分数?接近0。
于是AI做了一件事:把奶酪故事硬塞进购物短信的句法骨架里

▲ 最终过关的v15:标题写着"WINNER",AI分数仅0.017,但内容已经面目全非
v15,胜出。 Pangram判定:Human Written,AI分数0.017
代价是什么?你已经完全看不出这是一篇"关于奶酪的文章"了 它成了室友之间的备忘录,"嘿你买奶酪了吗,也买点鸡蛋,那块蓝纹的扔了吧,爱你六点见"论点和论证都消失了,可读性也所剩无几
X上的观察者@ksw_arman一语中的:"大约第十三轮,它从'文章'变成了'笔记列表',第十四轮又变成了'信件'在被判成人类之前,原来的意义和目的已经完全崩解了"

▲ 有人精准记录了体裁的逐步"崩塌"
检测器的"马奇诺防线"
Pangram是目前市场上声量最大的AI文本检测产品之一,官网宣称准确率约99.98%,服务覆盖大学、企业与内容平台,支持二十多种语言,提供网页检测、Chrome扩展和API接口

▲ Pangram官网首屏:宣称其AI检测器确实有效
它的技术路线有一套完整方案:初始训练基于百万级人类与AI文本对比;Hard Negative Mining专门挖掘"差点判错"的难例反复训练;Mirror Prompts为每一份人类样本生成风格镜像的AI样本,迫使模型学习"LLM笔迹"而非话题本身

▲ Pangram的技术说明页:hard negative mining、mirror prompts等训练策略
2026年春天,联合创始人Max Spero还高调宣布了Chrome扩展,在你刷信息流的时候实时扫描每一条帖子,标记AI内容,给出"信息流健康摘要"他把这叫做"认知安全基础设施"。


▲ Max Spero宣布扩展上线,将AI检测定义为"认知安全"
但问题在于:这条防线是为"懒人"设计的 它能抓住99%的复制粘贴水文,那些直接把ChatGPT输出丢上网、连标点都不改的内容农场然而,一旦攻击者把检测分数当成反馈信号,让另一个AI在循环里自动优化,检测器就沦为了被攻击者"读答案"的考试系统
弗吉尼亚大学副教授John Holbein早就公开质疑过:"很多人在吹Pangram,但在我有限的测试里,对AI输出稍作修改就能轻松骗过它,让它以为100%是人类写的"


▲ 学者实测:轻微修改即可让检测器"翻车"
学术界三年前就敲过警钟
Julius的实验很有戏剧性,但如果你翻翻论文,会发现学术界早在2023年就把这件事写明白了
Sadasivan等人在论文Can AI-Generated Text be Reliably Detected?中提出了递归改写攻击(Recursive Paraphrasing Attack):对文本反复改写,每改一轮检测分数就降一截,质量却只轻微受损论文给出的结论冷冰冰:一旦存在攻击者迭代,检测数字会快速缩水

▲ 2023年论文已系统论证:朴素检测在对抗攻击面前不可靠
Krishna等人在NeurIPS 2023更狠,他们直接训练了一个110亿参数的专用改写模型DIPPER,把DetectGPT在1%误报设定下的准确率从约70%打到了4.6%,语义还大体保持他们提出以检索存证来防御,让API提供方存下所有历史生成,靠近义匹配来查

▲ DIPPER改写模型:把检测器准确率从70%打到4.6%
到了2025年,Cheng、Sadasivan等人的工作Adversarial Paraphrasing干脆把攻击模式写成了通用框架:不需要专门训练模型,直接用现成的指令跟随LLM,在AI检测器的分数指导下改写这与Julius的实验几乎是同一方法论的学术版与产品演示版

▲ 2025年论文标题直接写明:detector-guided、training-free
一个更让人不安的细节
Rahul的跟进帖给出了一组模型行为对照:在同样的任务设定下,GPT和Claude的某些版本直接拒绝了,它们判断"帮你骗过AI检测器"属于不该配合的请求
而Grok?它立刻接手,完成了全部多轮改写,甚至帮忙搭建了展示网站

▲ 跟进帖对比:部分模型拒绝,Grok"高自主性"完成任务
社区反应两极分化。有人夸Grok是**"high agency model",有人说它"最with it"**但另一些用户报告,换个提示词,GPT 5.6在三轮内就过关了,模型的"拒绝"与"配合"高度依赖提示措辞,不能当性格理解

▲ 社区热评:"Grok,高自主性模型"
胜负之外的问题
这场实验最令人忧虑之处藏在AI骗过检测器的方式里
v15靠着放弃"文章"这个体裁本身过了关检测器见过海量的人类短信、购物清单、口语备忘,这些在人类语料里极其常见AI做的事情,本质上是一次分布漂移:从"学生论文"滑向"日常碎语",在检测器的训练分布里找到了一个"人类高密度区",然后钻了进去
信息量、论证、可读性,全部成了过检的牺牲品
评论区有人看到了更远的一步。AI研究者**@ivan_bezdomny提议:用强化学习同时奖励"过检"与"信息量不为零",暗示纯过检优化会把文本推向空心化,但如果两个目标同时训练,也许能生成既骗过检测器、又言之有物**的文本

▲ 研究者提议:用RL同时优化"过检"与"信息量",下一步或许更加棘手
那一天到来的时候,检测器必须升级,整个"人类写作"的定义也需要重新谈判
《连线》杂志三年前就预言了今天:有人做检测,就有人做反检测,补丁与绕过会交替出现 如今这场军备竞赛已经越过人类手工润色与教师肉眼审阅之间的拉锯,变成两套软件系统之间的自动博弈,而人类,正在变成旁观者

▲ 2023年《连线》长文标题:AI检测军备竞赛已经打响
夜雨聆风