夜雨聆风学习资料网

ARTICLE · 1078675

我拿 8 个去 AI 味工具改了同一篇稿子,挑工具的方法一直是错的

我拿 8 个去 AI 味工具改了同一篇稿子,挑工具的方法一直是错的

先说结论:这 8 个工具差在哪?不在谁改得好。差的是它们各自怎么定义「 AI 味」。

这个定义,你从 star 数看不出来,从 README 也看不出来。只能去读它的规则文件。

为什么要做这个测试

「去 AI 味」这个词在公众号里密集出现。我搜了一圈,同类内容至少十几个账号在写,标题公式高度统一:几个工具、几条指令、复制即用。

没有一篇做横向实测。全是推荐。

问题在这儿:这些文章读完,你还是不知道怎么挑。它们说「这个工具很强」,可没说它强在哪、对什么样的稿子强。

所以我做了个测试。 8 个工具,加一个不给任何规则的对照组,同一篇输入。

测试怎么做的

输入是我自己写的一篇模拟 AI 稿:某款模型发布的一段通稿, 621 字。症状按流传最广的那几条说法埋入,包括「在当今这个飞速发展的时代」「值得注意的是」「更重要的是」「这不是 A 而是 B 」「业内普遍认为」「重要里程碑」,收尾是「更加智能、更加高效、更加普惠」。

里面埋了 9 个事实校验点:发布日期、成本降幅、速度提升、基准分数、上下文长度、官方引语、发布方、模型名、比较对象。官方引语必须逐字保留。

8 个工具都是从 GitHub 克隆的,星数从 18.4k 到 36 ,相差五百多倍。规则文件、 commit 日期、每个工具的默认编辑口径都留了档。

先把这次实验最大的问题说清楚,它影响后面所有结论。

这篇输入是我自己写的,症状是按流行说法埋的。 我按「我觉得像 AI 味」的东西出题,这就预设了一套标准。某个工具对「 AI 味」的定义要是跟我不一样,它就会考砸。并不是因为它不行,只是因为我出错了题。

这件事在后面会变得很重要。

除了输入本身,还有三条限制: 8 个工具不是我亲手改的,是 8 个子代理各自读完规则文件后独立执行的,所以测到的方差里混着子代理对规则的理解差异;只测了一篇输入;稳定性那部分只挑了 3 个工具各重跑 2 次。

第一轮:星数什么也说明不了

先看最简单的指标:改完之后,原文那 9 处症状还剩下几处。

工具
星数
原样留存
renwei-writing
1.1k
0
human-writing
3.8k
0
(无规则对照)
—
0
writing-agent
427
1
humanizer-zh
18.4k
2
qu-ai-wei
603
2
humanize-chinese
36
2
lieflat-less-ai-tone
2.0k
6
shuorenhua
1.9k
8

(「原样留存」指该处原文表述在输出里还找得到。存留多不代表没干活,也不代表干得差。下面会解释。)

星数最高的 18.4k 和星数最低的 36 ,留存数一样,都是 2 。 星数居中的那两个,一个留了 6 处,一个留了 8 处。

只看这张表,最自然的结论是:那两个居中的工具在偷懒。

我第一轮就是这么想的。我准备拿它当文章的结论。

然后我读了 lieflat 的规则文件,发现自己错了。

那 6 处留存,不是没改,是不该改

lieflat 的 SKILL.md 里有 11 条改写规则。展开是:翻案腔、顿号罗列过密、相邻句结构同款、破折号滥用、冒号滥用、序数词当小标题、拟人化喻体、把已有的具体数据写回概括表述、禁用起手式、翻译腔五种、段首零主语评论。

「重要里程碑」不在里面。「更加智能、更加高效、更加普惠」也不在里面。

它保留这 6 处,是因为它的规则范围不覆盖它们。它改了什么?「值得注意的是」→「这一点值得注意」,「更重要的是」→「这一点更重要」,「这不是一次简单的版本迭代,而是……」→「这是……」。都在射程里。

命中就改,没命中就不动。它执行得很准确。

真正让我改判断的,是它仓库里的 RESEARCH.md 。

那里面记录了一次语料对照:人类写的 329 篇( 1,647,867 字符)对 AI 写的 300 篇。它拿这批语料去测那些流传很广的说法,推翻了一大批:

•流传说法「 AI 的句长比人类均匀 51 倍」:实测 0.87 倍,没有差异。它自己解释说, 51 倍那个数是切句缺陷造成的假象,早期版本只按句号断句, Markdown 表格和没有句号的长列表被当成一个句子。
•流传说法「 AI 爱用三连排比,×7.3 」:实测每百段 9.41 对 4.81 ,2.0 倍,降级处理。
•流传说法「 AI 的段落长度极均匀」:实测 0.94 倍,没有差异。

它还列了一张「不作为改写理由」的表,把句长均匀、被动句、名词化、句内同构排比、问句全部排除在改写范围外,理由是「实测与人类写作无差别」。

所以它保留那 6 处,是个有数据支撑的设计决策,不是能力不足。

而我的测试输入,恰好全部埋在它的射程之外。我拿它规则里明确不认的东西去考它。

有个细节值得单独说,它容易被误读。

我一开始以为 lieflat 是拿正则做替换的。它仓库里确实有 scripts/check-structure.py,里面有一组正则,值得注意|更重要的是|关键在于|真正的 全在里面,看着就像是拿来做关键词替换的。

我去读了源码。它只测量,不改写。 那组正则的功能是统计「段首零主语评论」在语料里的出现频率,用它算出 AI 是 0.61%、人类是 0.14%。check-translationese.py 同理,统计翻译腔标记每千汉字的出现频次。三个脚本里没有任何 rewrite、replace 函数。

换句话说:它用脚本做测量,用文字做规则。 量出倍率、定出边界,然后写一份 SKILL.md 交给模型执行。跟 humanize-chinese 把改写交给 Python 走的是两条路。

稳定性那组数据,才是真问题

第一轮测完,我给三个工具各重跑了两次,同样的输入、同样的模型。

humanizer-zh ( 18.4k 星, 31 项检查点):

次数
正文字数
对「业内普遍认为」这处
第一次
283
保留
第二次
163
删了
第三次
247
保留

同一段输入,三次跑出 163 、 247 、 283 三个长度。 第二次比第一次短了四成,连结尾段都删了。对同一个句子的处置,两次留着一次删掉。

lieflat ( 11 条规则): 三次分别 563 、 573 、 570 字,保留了同一批症状词。

shuorenhua ( 1.9k 星): 三次分别 597 、 603 、 609 字,每次都留下「里程碑」「白热化」「全方位」「更加智能」「彰显」。它每次只动三五个字,然后稳定地交稿。

为什么宽范围的工具反而不稳定

我猜答案在规则的形态里。

lieflat 的规则是「命中就改」:看到「值得注意的是」,补个回指词;看到破折号,拆成句号。改法唯一,跑一百次结果都一样。

humanizer-zh 的规则是「你判断」: 31 项检查点里有多少条需要模型现场判断?这句话算不算拔高?这个评价该不该留?「保留其局限」里的「局限」怎么算?

每次跑,判断都重新做一遍。判断一波动,输出就波动。

范围窄,是因为它把不属于自己射程的东西明确排除掉了,代价是覆盖不到。范围宽,能碰更多问题,代价是稳定性。

这是一个取舍,不是谁落后。

还有一种改法:什么都不改

第一轮里还有个结果我一直没想好怎么归类。

renwei-writing ( 1.1k 星)留下的症状是 0 处,但它交出来的正文只有 158 字,外加一份两千多字的报告逐处交代删掉了什么。报告开头那段说明了它为什么这么处理:

这段输入里没有位置、没有代价、没有手迹可保。这个输入本身就是模型按一句 prompt 一次性生成的,原文里不存在「某个具体的人说话的样子」。

它的结论是:加第一人称、加情绪、加场景锚点,等于凭空发明一个位置和代价。一个不存在的作者,不能靠改稿把他改出来。

所以它只做减法,把模板痕迹清掉,把事实原样留下。

这个立场和 lieflat 的「不作为改写理由」是同一件事的两面:一个是「这种写法人类也用,不算 AI 味」,一个是「这种文本里没人,别造假人」。两个工具都选择了不改。

顺带说一个反例

36 星的 humanize-chinese 是 9 个条件里唯一把改写交给代码的。

它有独立的 Python 脚本,零 LLM ,本地跑。跑 detect,它给出原文 91/100 的 AI 评分,还列了一堆统计特征:段落熵变异系数 0.049 、困惑度偏度 0.75 、短句占比 0%。

它不用模型判断,它用统计量。 所以它的执行最一致,包括那个只做一件事的第 6 步:把半角引号改成全角。

9 个条件里,只有这个动作的规则明确到不需要判断。

它的 README 自己也说得很清楚:「不能证明文章由谁撰写,也不保证通过任何 AI 检测器。」

检测分不能说明改得好不好,但它能说明另一件事:同一个工具里,越是能写成确定规则的部分,执行越可靠。 剩下那些需要判断的部分,还是得交给模型,还是会有波动。

那到底该怎么挑

第一条,去看它明确不改什么。

「不作为改写理由」那一节,信息量比「我能改什么」大得多。它告诉你这个工具对「 AI 味」的定义边界在哪,过了这条线的东西,你指望它也没用。

lieflat 那节写着句长均匀不改、被动句不改、名词化不改。你的稿子问题恰好是句长一成不变,那它就不是你的工具。

第二条,数它有几条带编号的规则。

十几条的偏保守,三十条以上的偏激进。数量少,意味着要现场判断的地方少,输出更稳定、更可预测。数量多,意味着覆盖广,但同一篇稿子跑两次可能给你两个版本。

第三条,别信星数。

这次实测里, 18.4k 和 36 星的两个工具留存症状一样多,而星数居中的两个几乎没动手。星数反映的是被发现程度和包装水平,跟它到底会改什么没关系。

第四条,也是这次测试真正的收获:去读它的规则文件,看有多少条是「看到 X 就改成 Y 」这种确定写法。

确定写法的比例越高,你越能预期它的输出。全是「判断这句话是否……」的工具,能力上限更高,但每次都要重新掷一次骰子。

第五条,也是最实在的:拿你自己的一段稿子,连跑三次。

三次结果一样,说明它靠规则干活,你可以预期它每一次的表现。三次结果差很多,说明它靠模型现场判断,你得多看几遍再决定用哪版。

回到那篇稿子

回到我自己那篇 621 字的稿子。

9 个条件全部完整保留了 9 个事实校验点,官方引语一个字没动。没有一个工具改坏事实。 这一条比我预想的干净。

它们只是各自按自己的定义,改了自己认为该改的地方。有的删掉 83%,有的只动三五个字,有的交回来一份诊断,说这段文字的问题不在词句上。

所以问题从来不是「哪个工具去 AI 味最强」。 是它认定的 AI 味,跟你的稿子的问题,是不是一回事。这件事在下载之前就能查清楚:打开它的规则文件,翻到「不改」那一节。


测试的原始数据:

大模型之间的竞争,今年一直没停过。9 月 22 日,Anthropic 发布了 Claude Opus 5.5。

先看成本和速度。相比 Opus 5,它的成本降低了 40%,输出速度快了 30% 以上;上下文窗口也扩展到了 1M token,长文档一次性处理成为可能。这几个参数凑在一起,改变的不只是纸面上的数字,实际用法会跟着变。

跑分方面,官方说它"性能可媲美 Claude Fable 5.1",在 Terminal-Bench 4.0 上拿到 66.4%。代码生成、文档理解、多轮对话、长文写作,这几块都有提升。

它的定位也在挪。以前是个回答问题的助手,现在更接近一个能一起干活的协作对象。这个变化有多大,可能得实际用上一段时间才看得清。

剩下的还是老问题。效率和可靠性能不能同时顾上,更强的能力普通用户能不能用得到。这些暂时没有现成答案。Opus 5.5 已经发出来了,接下来怎么用,各家自己试。

相关学习资料