读者偏爱AI故事,直到知道真相

The Decoder··作者 Matthias Bastian

关键信息

在第一项实验中,1682名参与者每人阅读一篇约1000词的故事,6篇中有3篇来自文学杂志或短篇集,另外3篇由ChatGPT-4.0根据人类原作的主题、风格和叙述视角提示生成。随后两项共905名参与者的实验中,读者即使直接对比两篇作品,也仍然无法以高于随机猜测的水平判断出处;自报AI使用经验略有帮助,而阅读小说经验并没有帮助。

资讯摘要

这篇报道介绍了一项多实验研究,核心问题是:读者能否区分人类写的短篇小说和ChatGPT-4.0生成的短篇小说。结果显示,在超过2500名参与者中,大多数人都做不到。第一项实验中,1682名参与者每人阅读一篇约1000词的故事,6篇作品里有3篇来自知名文学杂志和短篇小说集,另外3篇则由ChatGPT-4.0根据人类原作的主题、风格和叙事视角提示生成。研究者把参与者分成两组:一组被告知故事出自人类作者,另一组被告知故事来自ChatGPT,但这些标签实际上只对每组一半的人是真的。该研究由Sydney Sears和Deena Skolnick Weisberg完成,并发表在《Judgment and Decision Making》上。结果表明,读者不仅无法可靠判断作者身份,而且当他们以为作品是人类写作时,往往会给出更高评分。

与此同时,对AI持正面态度的参与者通常整体评分更高;当他们又被告知作品来自ChatGPT时,评分还会进一步上升,而AI怀疑者则出现相反效果。后两项实验共纳入905名参与者,研究者把任务变得更难:让每个人同时阅读一篇人类写作和一篇AI生成的故事,再判断哪篇出自机器,但结果仍然只是随机水平。研究者还发现,自报使用AI系统的经验与更高的识别能力有关,而阅读小说的经验并不能帮助区分出处。作者指出,高评分并不一定意味着文学意义上的更好,因为AI文本可能只是更顺畅、更容易处理、也更情绪化积极。研究数据和材料已在Open Science Framework上开放。

读者偏爱AI故事,直到知道真相

资讯正文

当读者知道一篇故事是机器写出来的之前,他们给 AI 生成的短篇小说打分会高于人类作品。

读者无法分辨 ChatGPT 生成的短篇故事和人类写作的短篇故事之间的区别。他们甚至给 AI 生成的文本打分更高,但前提是他们不知道这是机器写的。

在三项总计超过 2,500 名参与者的实验中,受试者在区分人类写作和 ChatGPT 生成的虚构短篇故事方面,表现并不比随机猜测更好。

在第一项实验中,1,682 名参与者中的每个人阅读了六篇短篇故事中的一篇,每篇大约 1,000 词。其中三篇出自知名文学杂志和短篇小说集,另外三篇则使用 ChatGPT 4.0 生成,提示词基于人类原作的主题、风格和叙事视角。

一半参与者被告知这篇故事是人类写的,另一半则被告知它来自 ChatGPT。根据发表在《Judgment and Decision Making》期刊上的研究,Sydney Sears 和 Deena Skolnick Weisberg 发现,这一信息在每组参与者中只有一半是准确的。

参与者对 AI 的态度也会影响他们的评分。无论故事实际由谁创作,只要被告知作者是人类,参与者给出的分数就更高。

对 AI 持积极态度的参与者总体上通常给出更高的评分。当他们还被告知故事来自 ChatGPT 时,评分会进一步上升。在对 AI 持怀疑态度的参与者中,这种效应则相反。此前一项关于 AI 生成诗歌的研究发现了类似的偏差。

在另外两项总计 905 名参与者的实验中,研究人员提高了任务难度。每个人都阅读一篇人类写作的故事和一篇 AI 生成的故事,然后必须判断哪一篇是哪一篇。即便可以直接比较,参与者的表现仍然没有比随机猜测更好。

自报对 AI 系统的使用经验与正确识别这些故事来源的能力呈正相关。另一方面,自报的虚构作品阅读经验并不能帮助参与者区分它们。

更高的评分并不一定意味着更好的写作

AI 生成的文本往往更流畅、更易读,也比人类写作的文本更情绪正向。根据作者的说法,这些特征或许可以解释为什么它们会得到更高评分,而不一定意味着这些 AI 故事在文学意义上真的更好。人们往往更偏好更容易处理的内容。

相比之下,高质量的文学虚构作品往往是有意设置得不那么容易进入,并要求读者付出努力去寻找意义。研究人员认为,一篇故事可以质量很高但并不十分吸引人,反之亦然。

短篇小说这一形式也很可能对 AI 有利。在 1,000 词内讲述一个连贯的故事,与在数百页篇幅中做到这一点,是非常不同的挑战。不过,研究人员的结论很明确:AI 能生成一些人们认为至少与人类作品不相上下的创意作品,但人们并不相信 AI 有这种能力。

这项研究的所有数据和材料都可在 Open Science Framework 上免费获取。

去年10月,石溪大学和哥伦比亚法学院的一项研究表明,读者的专业水平只在一定程度上起作用。在简单提示下,专业读者显然更偏好人类撰写的文本。但当模型专门针对某位作者的风格进行训练时,专家更偏爱 AI 生成的文本,在风格模仿方面的偏好频率高出 8 倍,在写作质量方面高出 2 倍。

来源与参考

  1. 原始链接
  2. Readers rate AI-generated short stories higher than human ones until they learn a machine wrote them

收录于 2026-08-09