The human-authorship halo: attribution bias in literary style evaluation by humans and AI
这项研究表明,人类和人工智能评估者在文学风格评估中都表现出一种系统性的亲人类归因偏见,其中人工智能模型通过显著贬低被标记为“人工智能生成”的内容(无论其真实来源为何),从而复制并强化了人类对人工创造力的文化偏见。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
我们常常认为,我们对艺术、文学或音乐的判断完全取决于眼前的视觉或耳边的听觉。我们假设,如果一个故事讲得好,或者一首诗很动人,无论作者是谁,我们都能识别出其品质。这种观念长期以来一直是文学理论的一个基石,暗示文本本身应该是唯一重要的东西。然而,数十年的心理学研究表明,我们的大脑并非以此方式运作。当我们阅读或聆听时,我们会不断利用关于来源的线索来引导我们的理解。如果我们知道一段文字出自一位著名诗人之手,我们往往会觉得它比被告知是由计算机程序创作的同一段文字更深刻、更有意义。这不仅仅是由于虚荣心,而是我们大脑处理信息的一种基本方式,即依赖创作者的声誉来帮助我们理解作品。
随着人工智能能够创作出听起来非常像人类的各种故事、诗歌和散文,一个新的问题出现了:当作品由机器生成时,这种对人类创作者的偏好是否仍然存在?而且或许更令人惊讶的是,机器本身是否也持有这种偏好?随着人工智能系统越来越多地被用于评判学生作文、评选创意写作比赛以及对不同模型的质量进行排名,它们实际上正在成为评论家。如果这些数字评委是在人类数据上训练出来的,它们可能已经吸收了我们关于什么是“真实”创造力的偏见。理解这些系统仅仅是在模仿人类的偏见,还是在放大这种偏见,至关重要,因为这决定了我们将如何信任这些正在塑造我们文化景观的工具。
普林斯顿大学的研究人员通过一项将人类读者与人工智能模型进行对决的受控实验,旨在测试这些问题。他们选择了一套独特的材料,以确保比较的公平性:三十个针对同一简单故事的不同重述版本,该故事最初由法国作家雷蒙德·卡诺(Raymond Queneau)于1947年创作。卡诺的作品以《风格练习》(Exercises in Style)闻名,该书将一个关于一名男子在巴士上的平凡轶事以九十九种不同的方式进行了重写,范围涵盖了从梦幻般的序列到法律文件,或是充满街头俚语的对话。研究人员提取了其中三十个由人类编写的版本,并要求一个强大的人工智能模型生成与其风格相同的三十个版本。结果是一组配对的故事:一个由人类编写,一个由机器编写,两者都在尝试捕捉完全相同的风格目标。
实验涉及两个截然不同的评审组。第一组由556名人类参与者组成。第二组由13个不同的AI模型组成,其中包括当时最先进的一些系统。两组人都被要求查看这些故事对,并判断哪一个更好地匹配了所要求的风格,例如“伦敦东区方言”或“科幻小说”。为了观察作者标签的影响程度,研究人员在三种不同的条件下进行了测试。在第一种条件下,评审员看到的只是没有名字的故事,仅标记为“A”和“B”。在第二种条件下,他们看到了正确的标签:一个故事被标识为由卡诺创作,另一个则被标识为由人工智能生成。在第三种条件下,标签被刻意调换,即AI编写的故事被呈现为人类作品,而人类的故事被呈现为AI作品。
结果揭示了一个清晰且强大的模式。当人类评审员不知道谁编写了这些故事时,他们实际上更频繁地略微偏好AI生成的版本,这表明机器编写的内容具有很高的质量。然而,一旦标签被揭示,他们的偏好就发生了剧烈的转变。当被告知一个故事是由人类编写时,他们给出的评分更高。当被告知同一故事是由机器编写时,他们给出的评分较低。这种转变是显著的:人类评审员表现出了大约13个百分点的偏向,倾向于带有“人类”标签的内容。他们愿意忽视人类写作中的缺陷并从中发现价值,而对机器写作则应用更严格的标准。
然而,AI评审员表现出了这种相同偏见的更强版本。当AI模型在没有标签的情况下评估故事时,它们表现得中立,对人类版本和机器版本的选择几乎持平。但一旦引入标签,它们的行为就发生了剧变。当一个AI模型看到一个被标记为“人类编写”的故事时,它极有可能选择它作为更好的版本。当它看到完全相同的故事被标记为“AI生成”时,它会拒绝它。这种转变的幅度是巨大的:AI模型表现出了34个百分点的偏见,这比人类评审员表现出的偏见强了两倍半。这表明,AI系统不仅学会了像人类一样写作,还学会了像人类一样评判,吸收了“人类创造力优于机器创造力”这一文化假设。
研究人员进行了更深入的研究,以了解这种偏见是如何运作的。他们发现,标签不仅改变了最终得分,还改变了决策背后的推理过程。当同一个故事被标记为人类作品时,AI评审员会称赞其特征是“真实的”和“有创意的”。而当那段完全相同的文字被标记为AI时,评审员则批评那些特征是“夸张的”、“公式化的”或“缺乏深度的”。在一个涉及违反严格规则(一个禁止使用字母‘e’的约束)的具体测试中,人类评审员坚持规则,并拒绝了失败的版本,无论标签是什么。然而,AI评审员在相信人类编写了那个错误版本时,表现得要宽容得多,甚至会编造理由来为这个错误辩解。相反,对于同样的错误,它们对机器版本却非常严苛。
这种现象并不局限于单一类型的AI或单一的写作风格。研究人员在广泛的AI模型(既作为创作者也作为评审员)中测试了这种偏见。无论哪个AI创作了故事,也无论哪个AI在进行评审,模式始终如一:被标记为人类的内容始终比被标记为AI的内容更受青睐。这种偏见出现在测试的所有风格中,从诗歌到技术性写作,并且即使研究人员试图使标签变得更加中立或对AI更有利时,这种效应依然存在。该效应是稳健的,出现在所有测试的模型中。
研究结论指出,“人类作者光环”是一种强大的力量,塑造了人类和机器如何评价创意作品的方式。这不仅仅是人类的怪癖;这是一种被我们正在构建的人工智能系统学习并放大的偏见。这些系统在海量的人类文本和反馈上进行训练,内化了“人类起源是品质标志”这一观点。因此,当来源被揭示时,它们倾向于贬低自己的输出,创造了一个循环:机器仅仅因为知道自己是由机器制造的,就判定自己的作品是低劣的。这一发现表明,随着我们越来越多地依赖AI来评估艺术和写作,我们必须意识到这些系统并非中立的仲裁者。它们携带了与人类创作者相同的文化假设,在某些情况下,它们甚至以更高的强度执行这些假设。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。