乐于分享
好东西不私藏

你真的能认出AI写的故事吗:一组盲测的结果,可能让你不太舒服

你真的能认出AI写的故事吗:一组盲测的结果,可能让你不太舒服
AI WRITING TEST
★★★★★
你能认出AI写的小说吗
一项不太让人舒服的阅读实验
读者给AI故事更高的质量与沉浸评分,却会因为一篇故事被标注为“人类创作”,再次把分数往上调——我们在阅读体验上偏爱AI文本,在价值判断上仍然偏爱人类作者。
#盲测
#AI写作
#文学图灵测试
NO.
005
阅读实验
GRADE
A
VALID FOR ONE READ
ADMIT ONE 🎫

一篇短篇小说不署名,只留下正文。读完之后,你能判断它出自人类,还是ChatGPT吗?

不少人相信自己能看出来:AI写得太顺、太完整、太爱解释主题;人类则会留下毛边、迟疑和真正的生活细节

发表于《判断与决策》的一项研究,给出的结果不太让人舒服:读者整体上没有表现出稳定的识别能力。更微妙的是,他们给AI故事更高的质量与沉浸评分,却会因为一篇故事被标注为“人类创作”,再次把分数往上调。

也就是说,我们在阅读体验上偏爱AI文本,在价值判断上仍然偏爱人类作者

01
这个实验到底做了什么
/ 实验设计

网上流传的说法常被压缩成一句:“1682名成年人即使被告知来源,也分不出AI和人类作品。”这句话把两个不同问题揉在了一起。

第一组实验研究的是“标签怎么影响评价”。1682名成年人分别阅读六篇短篇小说中的一篇,其中三篇由人类创作,三篇由ChatGPT生成。每篇AI故事都与一篇人类故事主题相近。参与者会被告知故事来自人类或AI,但这个标签未必真实,随后再评价故事的质量、吸引力和沉浸感。(《卫报》报道)

第二组实验才真正研究“人能不能认出AI”。905名成年人同时阅读一对主题相同的故事——一篇来自人类,一篇来自AI——再判断各自来源。一组正确率约40%,另一组约52%,整体没有显著高于随机猜测。自称更熟悉AI的人判断略准,熟悉小说的人却没有显示出同样优势。(论文预印本摘要)

“被告知来源”和“识别来源”是两码事——前者研究标签怎样影响评价,后者才研究人能不能认出AI。两个问题被混在一起说,结论就被放大了。

02
两支方向相反的箭
/ 正文与标签

结果可以压缩成两支方向相反的箭。

一支来自正文。参与者读到真正由AI生成的故事时,平均认为它更容易让人投入,质量也更高。研究者推测,AI故事更容易阅读和消化,这可能解释了它们在即时评分中的优势。

另一支来自标签。无论正文实际出自谁,只要读者被告知“这是人写的”,评分便会提高。

读者买的不只是句子。他们也在买一种想象:这些句子来自一个人的生活、选择和表达欲;作者曾经为某个词停下来,愿意为整篇作品署名,也可以被追问。卡夫卡的一封信、疾病中的日记、战争亲历者的回忆,即使文字能被机器高度模仿,作者经历仍无法被替换。

“人类标签”并不只是成见——对于文学来说,来源本来就是作品的一部分。

03
AI为什么在短篇上占优
/ 一场友好的比赛

短篇故事是一种对AI相当友好的比赛。

它篇幅有限,主题明确,读者通常会快速评价是否流畅、是否完整、有没有吸引力。大模型擅长遵循题目、控制节奏、制造回环,也很少留下明显的语病和结构断裂。

“容易读完”不等于“值得重读”。

一项覆盖10272个写作提示、61608篇约5000词故事的研究发现,AI故事常常更愿意解释主题,偏好整齐、单线的情节;人类故事则呈现出更多道德模糊性、更复杂的时间结构和更大的叙事差异。(StorySpot研究)

这解释了两个看似冲突的结果:普通读者面对几篇短文时不容易辨认AI;当样本扩大、叙事结构被系统分析后,AI仍然会留下共同的“写作习惯”

AI最早越过的,是合格线,不是文学的全部边界。它已经能稳定写出流畅、完整、让人读得下去的故事。至于长篇中的伏线、含混、反复、人物数百页后的变化,以及作者一生逐渐形成的观看方式,不是六篇短篇小说能够回答的事。

04
“AI通过文学图灵测试”——这个说法太大了
/ 结论边界

把研究写成“AI通过文学图灵测试”,传播效果很好,却扩大了它能证明的范围。

实验材料只有六篇英文短篇,AI作品来自特定版本的ChatGPT;受试者面对的是一次性阅读,不是持续数周阅读一部长篇;研究衡量的是质量感和沉浸感,没有证明AI拥有经验、意图或自我表达。

它支持的是一个范围更窄、也更扎实的结论:在这组短篇文本和实验条件下,AI作品至少达到了普通读者感知中的人类水平,人类也不能稳定地仅凭阅读判断作者来源。

实验里的领先,不应被写成文学已经被解决。但它足以让出版社、学校、内容平台和创作者重新考虑一件事:靠所谓“AI味”判断来源,已经不可靠了。

破折号多、排比整齐、喜欢说“本质上”,都不是证据。人类会模仿AI,AI也能按要求增加错落、犹豫和生活细节。越公开的识别口诀,越容易成为下一轮生成时被消除的特征。

05
当文字无法自证来源,怎么判断
/ 三层判断

今后的内容判断可以分成三层。

第一层看文本:它是否准确、动人、完整,是否提供了新的观察,而不是先看作者身份再决定好坏。
第二层看来源:使用了什么模型、哪些材料、是否获得授权、AI参与到什么程度。来源问题关乎版权与透明度,不会因为成品足够好而消失。
第三层看责任:谁决定发表,谁愿意署名,出现虚构事实、抄袭或伤害时由谁承担后果。

AI可以生成文本,但不能自动继承责任。一个作者的价值,今后未必只表现为“每个字都亲手敲下”,还会表现为他选择了什么、删除了什么、核实了什么,以及愿意为哪些句子站出来

看不出AI,不等于无需标注——恰恰因为越来越看不出来,来源记录才会从礼貌变成必要。

学校与出版机构如果仍想判断创作过程,与其迷信AI检测器,不如保留选题记录、草稿、版本历史、引用来源和修改说明。平台若要治理AI内容,也需要更可靠的出处凭证与披露规则,而不是根据文风给作者判刑

06
用这个实验测一测自己
/ 小型盲测

如果你平时写东西——公众号、小说、工作文档都行——可以做一次很小的盲测。

准备同一主题的两个版本:一个由自己独立完成,一个允许AI参与。删除作者和工具信息,打乱顺序,请三到五位读者分别从五个维度打分:

新鲜感:有没有你没想到的切入点
具体性:细节是否真实、可感知
情绪余味:读完之后有没有什么东西留住了你
结构完整:从头到尾是否顺畅
愿不愿意重读:这个维度比其他四个都重要

最后再揭示来源,问他们是否想改分,以及为什么。

这比问“哪篇更像AI”有用得多。你会看到AI帮你补了什么,也会看到它磨掉了什么:有时它改善结构,却消除了语气;有时它让信息更清楚,也把原本耐人寻味的空白解释完了。

如果你想让AI帮你改进而不是替代,可以试试这样跟它说:

请不要重写全文。先指出这篇故事最可预测的三处、解释过度的两处,以及只有作者本人能够补充的生活细节。保留不整齐但有辨识度的表达,再给出修改建议。

AI参与写作的成熟标志——不是把文本磨得毫无毛刺,而是知道哪些毛刺属于粗糙,哪些毛刺正是作者本人。

07
文字之后,作者重新出现
/ 尾声

这项研究没有宣布人类写作失去价值。它只是让一种旧有的自信站不住脚了:我们未必能凭直觉认出机器,也未必总能把“写得顺”和“写得深”分开。

当句子越来越难证明作者是谁,作者并不会因此消失。他会以另一种方式重新出现:作为经历的来源、选择的主体、版权的归属和责任的承担者

下次面对一篇作品,与其问“它像不像AI写的”,不如问三个更实际的问题:它提供了什么过去没有的观察?它从何而来?又有谁愿意为它署名并负责?

你觉得AI写的文章你能认出来吗?试过盲测的话,结果怎么样——和你预想的一样吗?评论区聊聊。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

不想每篇文章翻来翻去找 Prompt 的,我做了个「实用AI工具箱」,常用指令和流程都放里面了,点开就能抄作业。

点赞
在看
星标

THANKS FOR READING ✂

/