摘要:8月5日,《判断与决策》期刊发表研究显示,读者难以区分AI与人类创作的短篇小说,AI故事在质量和吸引力上评分更高,但“人类创作”标签仍能获得更高评价。超1600名参与者中,识别准确率最低仅39.9%,与随机猜测无异。文学创作边界正被重新定义。
如果告诉你,你刚读完的一篇精彩短篇小说出自AI之手,你会惊讶吗?最新研究显示,惊讶可能是多余的——因为多数人根本分不出来。
当地时间8月5日,一项发表于剑桥大学出版社旗下学术期刊《判断与决策》(Judgment and Decision Making)的研究,对AI与人类在文学创作上的界限提出了新的挑战。研究由美国维拉诺瓦大学心理与脑科学系主导,资深作者迪娜·斯科尔尼克·韦斯伯格博士(Dr. Deena Skolnick Weisberg)领衔。团队用3篇已出版的人类短篇小说和3篇ChatGPT生成的对应故事,对超过1600名18至81岁的成年人进行了测试。
AI故事评分更高,但“人类”标签更受偏爱
在第一项实验中,1682名参与者阅读了其中一篇故事,并被(正确或不正确地)告知作者是人类还是AI。结果显示,阅读AI生成故事的参与者给出的质量和吸引力评分更高。然而,无论故事实际由谁创作,只要被告知出自人类之手,参与者就会给出更高的分数。
韦斯伯格博士指出,这一结果揭示了人们对人类叙事的固有偏好,同时也表明公众对AI能力的假设“越来越过时了”。她解释说,AI写作往往更清晰、更直接、更易于处理,而人类故事通常更微妙、更复杂——人们可能普遍更喜欢可预测性,因为复杂或微妙的内容需要消耗更多脑力。
多数读者无法可靠区分,准确率与随机猜测无异
在后续两项实验中,905名参与者需阅读主题相同的两篇故事(一篇人类创作、一篇AI生成),并判断各自的作者。结果令人意外:一项实验中仅约39.9% 的参与者判断正确,低于随机猜测水平;另一项实验准确率为52%,仅略高于随机水平。研究作者据此指出,“没有证据表明参与者能够稳定地区分人类创作的故事与人工智能生成的故事”。
值得注意的是,自述小说阅读经验丰富的人并未表现出更高的判断准确率。真正起到作用的,是对AI系统的熟悉程度——AI素养越高,识别AI写作的能力越强。韦斯伯格博士表示,熟悉AI系统的人能识别出AI写作的典型模式,如“em dash(长破折号)”和特定句式结构,“这表明提高AI素养是帮助人们驾驭这个新AI世界的一种方法”。
创作边界正在模糊,识别仍是难题
这项研究验证了此前多项研究的发现——人们在不同格式(包括短篇小说、诗歌和散文)中都倾向于喜欢AI生成的内容。今年早些时候,英联邦短篇小说奖就遇到了类似问题:网络读者指出五篇获奖作品中有三篇疑似AI生成,AI检测工具也支持了这一判断,但出版商的独立核查结果并不明确。
韦斯伯格博士强调,这并不意味着人类作者变得无关紧要。人们通过写作表达自我、挑战自己或理解自身经历,AI能生成类似人类创作的故事并不会改变这些价值。她指出,未来或许需要为AI小说以及人机共同创作的小说留出空间。
当文学创作的边界在技术与人文的交汇处变得模糊,读者分辨能力的局限或许只是一个开始。正如研究所揭示的:AI写故事评分可以高于人类,但人类对“人类创作”这一标签的偏爱依然顽固。这两股力量的拉扯,正在重新定义“创作”二字的分量。



