一篇短篇小说不署名,只留下正文。读完之后,你能判断它出自人类,还是ChatGPT吗?

不少人相信自己能看出来:AI写得太顺、太完整、太爱解释主题;人类则会留下毛边、迟疑和真正的生活细节。
发表于《判断与决策》的一项研究,给出的结果不太让人舒服:读者整体上没有表现出稳定的识别能力。更微妙的是,他们给AI故事更高的质量与沉浸评分,却会因为一篇故事被标注为“人类创作”,再次把分数往上调。
也就是说,我们在阅读体验上偏爱AI文本,在价值判断上仍然偏爱人类作者。
网上流传的说法常被压缩成一句:“1682名成年人即使被告知来源,也分不出AI和人类作品。”这句话把两个不同问题揉在了一起。
第一组实验研究的是“标签怎么影响评价”。1682名成年人分别阅读六篇短篇小说中的一篇,其中三篇由人类创作,三篇由ChatGPT生成。每篇AI故事都与一篇人类故事主题相近。参与者会被告知故事来自人类或AI,但这个标签未必真实,随后再评价故事的质量、吸引力和沉浸感。(《卫报》报道)

第二组实验才真正研究“人能不能认出AI”。905名成年人同时阅读一对主题相同的故事——一篇来自人类,一篇来自AI——再判断各自来源。一组正确率约40%,另一组约52%,整体没有显著高于随机猜测。自称更熟悉AI的人判断略准,熟悉小说的人却没有显示出同样优势。(论文预印本摘要)

“被告知来源”和“识别来源”是两码事——前者研究标签怎样影响评价,后者才研究人能不能认出AI。两个问题被混在一起说,结论就被放大了。
结果可以压缩成两支方向相反的箭。
一支来自正文。参与者读到真正由AI生成的故事时,平均认为它更容易让人投入,质量也更高。研究者推测,AI故事更容易阅读和消化,这可能解释了它们在即时评分中的优势。
另一支来自标签。无论正文实际出自谁,只要读者被告知“这是人写的”,评分便会提高。
读者买的不只是句子。他们也在买一种想象:这些句子来自一个人的生活、选择和表达欲;作者曾经为某个词停下来,愿意为整篇作品署名,也可以被追问。卡夫卡的一封信、疾病中的日记、战争亲历者的回忆,即使文字能被机器高度模仿,作者经历仍无法被替换。
“人类标签”并不只是成见——对于文学来说,来源本来就是作品的一部分。
短篇故事是一种对AI相当友好的比赛。
它篇幅有限,主题明确,读者通常会快速评价是否流畅、是否完整、有没有吸引力。大模型擅长遵循题目、控制节奏、制造回环,也很少留下明显的语病和结构断裂。
但“容易读完”不等于“值得重读”。
一项覆盖10272个写作提示、61608篇约5000词故事的研究发现,AI故事常常更愿意解释主题,偏好整齐、单线的情节;人类故事则呈现出更多道德模糊性、更复杂的时间结构和更大的叙事差异。(StorySpot研究)
这解释了两个看似冲突的结果:普通读者面对几篇短文时不容易辨认AI;当样本扩大、叙事结构被系统分析后,AI仍然会留下共同的“写作习惯”。
AI最早越过的,是合格线,不是文学的全部边界。它已经能稳定写出流畅、完整、让人读得下去的故事。至于长篇中的伏线、含混、反复、人物数百页后的变化,以及作者一生逐渐形成的观看方式,不是六篇短篇小说能够回答的事。
把研究写成“AI通过文学图灵测试”,传播效果很好,却扩大了它能证明的范围。
实验材料只有六篇英文短篇,AI作品来自特定版本的ChatGPT;受试者面对的是一次性阅读,不是持续数周阅读一部长篇;研究衡量的是质量感和沉浸感,没有证明AI拥有经验、意图或自我表达。
它支持的是一个范围更窄、也更扎实的结论:在这组短篇文本和实验条件下,AI作品至少达到了普通读者感知中的人类水平,人类也不能稳定地仅凭阅读判断作者来源。
实验里的领先,不应被写成文学已经被解决。但它足以让出版社、学校、内容平台和创作者重新考虑一件事:靠所谓“AI味”判断来源,已经不可靠了。
破折号多、排比整齐、喜欢说“本质上”,都不是证据。人类会模仿AI,AI也能按要求增加错落、犹豫和生活细节。越公开的识别口诀,越容易成为下一轮生成时被消除的特征。

今后的内容判断可以分成三层。
AI可以生成文本,但不能自动继承责任。一个作者的价值,今后未必只表现为“每个字都亲手敲下”,还会表现为他选择了什么、删除了什么、核实了什么,以及愿意为哪些句子站出来。

看不出AI,不等于无需标注——恰恰因为越来越看不出来,来源记录才会从礼貌变成必要。
学校与出版机构如果仍想判断创作过程,与其迷信AI检测器,不如保留选题记录、草稿、版本历史、引用来源和修改说明。平台若要治理AI内容,也需要更可靠的出处凭证与披露规则,而不是根据文风给作者判刑。
如果你平时写东西——公众号、小说、工作文档都行——可以做一次很小的盲测。
准备同一主题的两个版本:一个由自己独立完成,一个允许AI参与。删除作者和工具信息,打乱顺序,请三到五位读者分别从五个维度打分:
最后再揭示来源,问他们是否想改分,以及为什么。
这比问“哪篇更像AI”有用得多。你会看到AI帮你补了什么,也会看到它磨掉了什么:有时它改善结构,却消除了语气;有时它让信息更清楚,也把原本耐人寻味的空白解释完了。
如果你想让AI帮你改进而不是替代,可以试试这样跟它说:
AI参与写作的成熟标志——不是把文本磨得毫无毛刺,而是知道哪些毛刺属于粗糙,哪些毛刺正是作者本人。
这项研究没有宣布人类写作失去价值。它只是让一种旧有的自信站不住脚了:我们未必能凭直觉认出机器,也未必总能把“写得顺”和“写得深”分开。
当句子越来越难证明作者是谁,作者并不会因此消失。他会以另一种方式重新出现:作为经历的来源、选择的主体、版权的归属和责任的承担者。
下次面对一篇作品,与其问“它像不像AI写的”,不如问三个更实际的问题:它提供了什么过去没有的观察?它从何而来?又有谁愿意为它署名并负责?
你觉得AI写的文章你能认出来吗?试过盲测的话,结果怎么样——和你预想的一样吗?评论区聊聊。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
不想每篇文章翻来翻去找 Prompt 的,我做了个「实用AI工具箱」,常用指令和流程都放里面了,点开就能抄作业。
THANKS FOR READING ✂
/
夜雨聆风