ARTICLE · 1029684
有人用283万字做实验,把AI味变成了统计题
有人用283万字做实验,把AI味变成了统计题每天用AI写东西的人,对某些句式的厌恶是生理性的。「不是A而是B」的对举,滥用到发指的破折号,动不动「主要有以下几种场景」。 这些句子单独看都没毛病。但它们以特定密度反复出现的时候,就是一股扑面而来的气息。 去AI味的开源项目不少,我都试过,有用。但用久了发现两个毛病:规则覆盖不全,很多我感觉得到的AI味,规则里没写;误伤严重,我自己原本的表达习惯也被一并干掉了。 根源是一样的。那些项目的规则,来源基本是个案观察和语感总结,没人系统检验过。 有个博主干了件狠事。他不用语感,用数据。 
他先收集了329篇真人写的文章,164.8万字。 AI这边麻烦一点。要控制变量:同样的话题,同样的体裁,不联网,不给任何风格指令。他建了个workflow,5个agent分别用Claude、DeepSeek、Gemini、GPT、Kimi写作,每个模型60篇,晚上下班启动,第二天上班跑完。 合计629篇,283万字。 然后逐项算频率。某特征AI的使用频率达到人类2倍以上,才算显著;0.8到1.25倍之间,算没有差异。 他一开始提了26项候选特征。 过检验的,11项。 也就是说,网上流传的那些AI味清单,一大半在数据面前站不住。 最强的一项不在词汇,在篇章结构。 叫「段首零回指评论」,AI的频率是人类的4.4倍。AI爱在新段落开头直接甩一句评价,比如「听起来像一条功能描述」,但不交代说的是什么,读者得回头翻上文才知道。改起来简单到离谱,补个「这」字就行。 比喻那条更有意思。作者本来认定AI爱用比喻,让脚本统计了比喻句总量,结果AI反而比人类用得少。 他没把这条扔掉,继续细分,发现AI真正超标的是拟人化比喻。「像一位不知疲倦的助手」这种,AI用得明显多。模型并不真的理解什么像什么,只是把看起来相关的东西硬凑到一起。 最反直觉的是设问。 「AI爱设问」几乎是所有去AI味建议的标配。实测下来,人类的设问频率是AI的17倍。五个模型都不爱用设问句。 你要是按「少用设问」去改稿,只会改得离人更远。 初测的时候,「句长均匀度」这个特征显示AI是人类的51倍,全场最强,他一度把它排在规则第一条。 后来发现是切句程序出了bug。Markdown表格没句号,被当成了一整个句子,有一组甚至跑出来一个19335字的「段落」。 修正重测,比值0.87。两侧根本没有差异。 问句小标题也是。Agent拿「每千字」当分母,算出32倍。可AI本来就爱写小标题,一篇十来个,人类只有一两个,基数差了5到10倍。换成占小标题总数的比例,重算,差异消失。 他吸取的教训就一句话:改规则之前,先抽样看20条命中,再看频率。 研究还顺带发现,根本不存在统一的「AI文风」。破折号,DeepSeek每千字5.16次,GPT只有0.11,差47倍。拿单一模型总结的AI特征,换个模型就全不成立。 11条规则全文在他开源的skill里,GitHub搜lieflat-less-ai-tone。 有一条方向和其他九条相反,值得单独说:往文里加数据。AI的数字密度只有人类的0.35倍,通篇没有数字的文章,读起来特别「滑」。翔实的数据支撑本身就在对抗AI味。 最后他有个判断,我记到现在:能让AI不用破折号,但很难让它明白一个比喻什么时候才算贴切。skill能修的只有局部,写作水平的天花板,还是要等模型预训练自己往前走。 283万字不算多,他自己也说不够。但面对一个所有人都在凭感觉发言的话题,他选择去数一遍。这个姿态比11条规则值钱。 项目地址:https://github.com/larashero3-dotcom/lieflat-less-ai-tone
