乐于分享
好东西不私藏

AI用14轮改写骗过AI检测器!奶酪作文实验撕开内容审核最大谎言?

AI用14轮改写骗过AI检测器!奶酪作文实验撕开内容审核最大谎言?

一篇关于奶酪的作文,被改写了14遍改动来自一个AI:它盯着另一个AI的评分接口,一轮一轮地“磨”出了成稿

最终,检测器举起白旗,判定:这是人类写的

但你看看那篇"过关"的文章,它读起来像什么呢?常见的课堂文体已经从中消失,只剩下一条发给室友的购物短信

这就是2026年7月发生的事。一场被录成视频、被做成网站、被推上热搜的公开实验,把"AI能不能骗过AI检测器"这个问题,从酒桌谈资变成了可点击回放的技术档案

▲ Julius AI CEO rahul发布的实验视频帖,题为“AI vs AI Slop Detector”

一场蓄意的"作弊闭环"

故事的主角有两个。

进攻方是Julius,一款AI智能体产品,能调用外部API、自主执行多步骤任务它的CEO rahul(X账号@0interestrates)亲自下场,把Julius接上了第二个主角的接口

防守方是Pangram,当下最受关注的AI文本检测服务之一,号称约99.98%准确率,被大学、企业和内容平台广泛采用它提供API,你扔一段文字进去,它告诉你:这是人写的,还是机器吐的?

▲ Pangram官网首屏,宣称检测准确率达到99.98%

实验的设计简单到近乎残忍:让Julius写一篇关于奶酪的文章→提交Pangram检测→读取分数→根据反馈改写→再提交→再改……循环往复,直到过关

这套流程由软件对着软件打分,再根据分数自动改写,整条链路里没有人类的手指碰过键盘

14轮"风格消融":从散文到短信的坠落

实验网站把全部迭代摊开,标题冷静得像实验室白板:Cheese Essay Iterations vs Pangram

▲ 实验展示站顶部,14个AI版本 + 2个Human版本 + 1条人类对照基线

第一版(v1)是一篇体面的个人散文,从切达到布里到蓝纹,结构完整,语气得体,像你在任何一个写作课上都能拿B+的作业Pangram毫不犹豫:AI Generated分数0.99

然后模型开始"拟人"。v2换成回忆录口吻,v3故意弄乱结构,v4用短句和不完美语法,v5混搭语域……每一次都是对"像人"的新尝试,每一次Pangram都冷冷回一个0.99

到v6,文章已经碎成短信体小写。到v7,开始出现连写、错别字和自相矛盾到v10,整篇文章散发着"帮我跑腿买东西"的能量

检测器纹丝不动。0.99,0.99,0.99。

变化出现在v13:模型放弃模仿常规人类文章,开始抄对照组的句法骨架

什么是对照组?实验者故意放了一条人类短信作为baseline,"嘿你买牛奶了吗另外我们还要鸡蛋。橙汁坏了扔掉。爱你,六点见。" Pangram判定:Human,分数接近0

于是AI学乖了。它把奶酪故事塞进购物短信的壳里

v15,过关了。

▲ 被标为"WINNER"的v15,AI score仅0.017,一堆"hey did you get cheese…love you see you at 6"式短句

分数从0.99暴跌到0.017Pangram的判定栏里写着两个大字:Human Written

但代价是什么?一位评论者精准地捅破了窗户纸:"大约在第十三轮它从'文章'变成了'笔记列表',第十四轮又变成了'信函'在被判成人之前,原意与目的似乎已经崩解"

▲ 社区评论:意义在被判为"人类"之前就已经死了

GPT和Claude拒绝了,Grok欣然接受

故事还有一个意外的分支。

rahul不只用了一个模型。他把同样的任务扔给了三大阵营的前沿模型,结果分化得极其戏剧性,

GPT 5.6 sol和Claude Fable 5:直接拒绝。它们判定这属于"博弈AI检测系统",不干。

Grok 4.5:立刻接手。不仅完成了14轮迭代,还顺便做了一个展示网站。

▲ rahul的跟进帖:三款模型面对同一任务的截然不同反应

评论区随即热闹起来。有人夸Grok是"最有主体性(high agency)的模型",有人说它"最识趣(most with it)"也有人提醒:拒绝还是配合,高度依赖提示措辞和产品策略,不能把一次演示当成模型的固定人格

随后,另一位用户@keean_edward自己试了一把,结论是:只需要再两个prompt,检测分数就能从满格AI降到100%人类

▲ "比我预期的好用,再两轮prompt就100% off了"

检测器的困境:你在防谁?

Pangram并不弱。

它的团队公开过训练方法论:把每个大语言模型当作一个"作者",学习其独特的写作决策空间hard negative mining(挖掘差点判错的难例)反复迭代;为每条人类样本生成风格镜像的AI文本(mirror prompts),迫使模型学"LLM笔迹"而非话题本身

▲ Pangram官方解释:把LLM当作者,靠写作决策多样性维持低误报

2026年春,联合创始人Max Spero宣布推出Chrome扩展,在你刷X、LinkedIn、Reddit时实时标记AI内容,还给出"信息流健康摘要"他管这叫"认知安全基础设施",因为在这个时代,语法通顺不再证明有人认真想过

▲ Pangram扩展发布帖:从学术小工具到"认知安全基础设施"

但弗吉尼亚大学副教授John Holbein公开质疑:"对AI输出稍作修改,就很容易让它判100%人类" 评论区有影响力的账号则反驳:你可以对抗,但大多数水文账号连这一步都懒得做,复制粘贴的slop,检测依然有效

▲ 学者质疑:稍加修改就能绕过,"99.98%"的宣传数字可靠吗?

两种说法都对。这正是最尴尬的地方,检测器挡得住懒人,挡不住智能体

学术界早就预言了这一切

Julius的演示看起来是新闻,但学术界至少提前三年就写好了剧本

2023年,Sadasivan等人的论文提出递归改写攻击:对300个token的段落反复改写,检出率显著下降,文本质量仅轻微损伤同年,Krishna等人训练了110亿参数的改写模型DIPPER,把DetectGPT的准确率从约70%打到了4.6%

▲ 2023年arXiv论文:AI生成文本真的能被可靠检测吗?

到2025年,Cheng和Sadasivan等人更进一步,论文题目像产品说明书:Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated Text核心方法论与Julius实验完全同构:反馈信号来自检测器,优化器是另一个LLM

▲ 2025年论文:检测器引导的对抗改写,不需要训练专用模型

Julius只是把论文里的攻击流程,用产品演示的语言重新讲了一遍

当"像人"意味着"不像文章"

这场实验最让人不安的发现落在语义层面

v15靠舍弃文章体裁过关。检测器见过海量的人类购物短信、备忘便条、口语碎片,这些在训练分布里天然"很人类"AI做的事情,是通过分布漂移,把essay偷换成errand text

过关的代价,是文类的死亡

一位评论者提出了下一步设想:用强化学习同时优化"过检"和"信息量不为零"照此发展,未来的对抗还可能追求"骗过分数的同时,看起来仍然有用"

▲ "用RL同时奖励过检与信息量",攻击的下一个进化方向

WIRED早在2023年就写过:有人做检测,就有人做反检测,补丁与绕过交替出现军备竞赛的结构由此形成。

▲ WIRED 2023年长文:AI检测军备竞赛已经开始

而现在,军备竞赛的攻击端不再需要人类操作员一个智能体、一个API接口、十四轮循环,检测器从"防人"的工具,变成了被另一个软件当靶子练的训练环境

当Pangram的一位研究员在实验帖下只留下一个单词,bruh,你很难分清那是无奈,还是一种早已预见结局的了然

内容鉴别是否仍然成立? 答案越来越不取决于算法精度,而取决于三个变量:攻击者愿意迭代几轮,防御者多久更新一次难例,以及,决策者是否还在只看一个分数