读者偏爱AI故事,直到知道真相
The Decoder··作者 Matthias Bastian
关键信息
在第一项实验中,1682名参与者每人阅读一篇约1000词的故事,6篇中有3篇来自文学杂志或短篇集,另外3篇由ChatGPT-4.0根据人类原作的主题、风格和叙述视角提示生成。随后两项共905名参与者的实验中,读者即使直接对比两篇作品,也仍然无法以高于随机猜测的水平判断出处;自报AI使用经验略有帮助,而阅读小说经验并没有帮助。
资讯摘要
这篇报道介绍了一项多实验研究,核心问题是:读者能否区分人类写的短篇小说和ChatGPT-4.0生成的短篇小说。结果显示,在超过2500名参与者中,大多数人都做不到。第一项实验中,1682名参与者每人阅读一篇约1000词的故事,6篇作品里有3篇来自知名文学杂志和短篇小说集,另外3篇则由ChatGPT-4.0根据人类原作的主题、风格和叙事视角提示生成。研究者把参与者分成两组:一组被告知故事出自人类作者,另一组被告知故事来自ChatGPT,但这些标签实际上只对每组一半的人是真的。该研究由Sydney Sears和Deena Skolnick Weisberg完成,并发表在《Judgment and Decision Making》上。结果表明,读者不仅无法可靠判断作者身份,而且当他们以为作品是人类写作时,往往会给出更高评分。
与此同时,对AI持正面态度的参与者通常整体评分更高;当他们又被告知作品来自ChatGPT时,评分还会进一步上升,而AI怀疑者则出现相反效果。后两项实验共纳入905名参与者,研究者把任务变得更难:让每个人同时阅读一篇人类写作和一篇AI生成的故事,再判断哪篇出自机器,但结果仍然只是随机水平。研究者还发现,自报使用AI系统的经验与更高的识别能力有关,而阅读小说的经验并不能帮助区分出处。作者指出,高评分并不一定意味着文学意义上的更好,因为AI文本可能只是更顺畅、更容易处理、也更情绪化积极。研究数据和材料已在Open Science Framework上开放。

资讯正文
当读者知道一篇故事是机器写出来的之前,他们给 AI 生成的短篇小说打分会高于人类作品。
读者无法分辨 ChatGPT 生成的短篇故事和人类写作的短篇故事之间的区别。他们甚至给 AI 生成的文本打分更高,但前提是他们不知道这是机器写的。
在三项总计超过 2,500 名参与者的实验中,受试者在区分人类写作和 ChatGPT 生成的虚构短篇故事方面,表现并不比随机猜测更好。
在第一项实验中,1,682 名参与者中的每个人阅读了六篇短篇故事中的一篇,每篇大约 1,000 词。其中三篇出自知名文学杂志和短篇小说集,另外三篇则使用 ChatGPT 4.0 生成,提示词基于人类原作的主题、风格和叙事视角。
一半参与者被告知这篇故事是人类写的,另一半则被告知它来自 ChatGPT。根据发表在《Judgment and Decision Making》期刊上的研究,Sydney Sears 和 Deena Skolnick Weisberg 发现,这一信息在每组参与者中只有一半是准确的。
参与者对 AI 的态度也会影响他们的评分。无论故事实际由谁创作,只要被告知作者是人类,参与者给出的分数就更高。
对 AI 持积极态度的参与者总体上通常给出更高的评分。当他们还被告知故事来自 ChatGPT 时,评分会进一步上升。在对 AI 持怀疑态度的参与者中,这种效应则相反。此前一项关于 AI 生成诗歌的研究发现了类似的偏差。
在另外两项总计 905 名参与者的实验中,研究人员提高了任务难度。每个人都阅读一篇人类写作的故事和一篇 AI 生成的故事,然后必须判断哪一篇是哪一篇。即便可以直接比较,参与者的表现仍然没有比随机猜测更好。
自报对 AI 系统的使用经验与正确识别这些故事来源的能力呈正相关。另一方面,自报的虚构作品阅读经验并不能帮助参与者区分它们。
更高的评分并不一定意味着更好的写作
AI 生成的文本往往更流畅、更易读,也比人类写作的文本更情绪正向。根据作者的说法,这些特征或许可以解释为什么它们会得到更高评分,而不一定意味着这些 AI 故事在文学意义上真的更好。人们往往更偏好更容易处理的内容。
相比之下,高质量的文学虚构作品往往是有意设置得不那么容易进入,并要求读者付出努力去寻找意义。研究人员认为,一篇故事可以质量很高但并不十分吸引人,反之亦然。
短篇小说这一形式也很可能对 AI 有利。在 1,000 词内讲述一个连贯的故事,与在数百页篇幅中做到这一点,是非常不同的挑战。不过,研究人员的结论很明确:AI 能生成一些人们认为至少与人类作品不相上下的创意作品,但人们并不相信 AI 有这种能力。
这项研究的所有数据和材料都可在 Open Science Framework 上免费获取。
去年10月,石溪大学和哥伦比亚法学院的一项研究表明,读者的专业水平只在一定程度上起作用。在简单提示下,专业读者显然更偏好人类撰写的文本。但当模型专门针对某位作者的风格进行训练时,专家更偏爱 AI 生成的文本,在风格模仿方面的偏好频率高出 8 倍,在写作质量方面高出 2 倍。
来源与参考
收录于 2026-08-09