When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models
本研究表明,不同的语言模型表现出一种“引用单调性”,即由于共享的内容层级偏好过滤器,它们会不成比例地选择同一组狭窄的真实论文子集,这种系统性偏差即使在消除幻觉且无法仅通过均衡检索或混合供应商来解决的情况下依然存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,科学进步的方式一直依赖于一种简单的、人类的习惯:研究人员阅读他人的著作,并决定在自己的写作中提及哪些论文。这种引用行为不仅仅是一种形式;它是科学信誉的货币。当一篇论文被频繁引用时,它就会获得可见度,从而引发被称为“马太效应”的循环——即富者愈富。这种动态一直依赖于人类读者,他们能够观察作者的声望、期刊的地位或论文过去的成功,并让这些信号引导他们的选择。但一种新的力量正在进入这个领域。人工智能正超越单纯的语法检查,开始起草整个文献综述,并筛选出那些塑造科学界认知的参考文献。问题不再仅仅是这些机器能否写作,而是它们会选择阅读什么。如果要求人工智能寻找某个主题最重要的研究成果,它仅仅是在模仿人类的偏见,还是在创造一种全新的偏见?
一组研究人员试图通过构建一个受控实验来回答这个问题,该实验剥离了通常会影响引用的所有因素。他们收集了关于特定主题的 120 篇真实的科学论文,但在将它们展示给人工智能之前,隐藏了所有常见的地位信号。作者姓名被替换成了虚假姓名,出版年份经过了打乱,每篇论文被引用的次数也被完全移除。随后,AI 模型被要求撰写简短的评论或立场论文,但有一个严格的规则:在每一轮中,它们最多只能提及所展示的 30 篇论文中的 10 篇。这种稀缺性迫使模型做出真正的抉择,而非列出它们看到的所有内容。为了确保结果并非偶然,研究人员将 AI 的选择与一个计算机从同一列表中随机抽取论文的基准进行了对比,同时还要求八位人类专家在完全相同的条件下做出同样的决策。
结果揭示了一个显著且统一的模式。虽然人类专家对论文的引用分布得相当均匀,对待论文的方式与随机抽取者几乎一致,但测试的所有 AI 模型都将注意力集中在极小且狭窄的论文子集上。在人类组中,前 10% 的论文获得了约 19% 的引用,这接近于随机概率的预期。相比之下,AI 模型将 23% 到 30% 的引用集中在了前 10% 的论文上。更重要的是,这些模型一致忽略了大量展示给它们的论文,甚至有些论文在被展示了数十次后仍未被引用。这并非由于机器编造了虚假参考文献;它们引用的每一篇论文都是真实的,它们忽略的每一篇也是真实的。失败之处不在于幻觉,而在于一个共享的、无形的过滤器,它决定了哪些真实的论文值得阅读。
或许最令人不安的发现是,无论这些模型是由哪家公司开发的,这种过滤器都是相同的。无论是 OpenAI、Google 还是 Anthropic 开发的 AI,它们都青睐完全相同的论文,并忽略完全相同的论文。研究人员发现,这 11 个不同模型的偏好如此相似,以至于可以用一个单一的、共享的“可引用论文”特征图谱来描述。这个图谱并非基于作者姓名或其发表的期刊,因为这些信息已被隐藏。相反,它完全由摘要的文本驱动。这些模型似乎对值得关注的特定风格或类型的内容达成了共识,倾向于那些听起来像是核心理论研究的论文,而系统性地忽视了应用型研究,即便这些应用型论文同样真实且具有相关性。
为了理解这是一种学习到的记忆(对过往引用的记忆)还是对质量的真实判断,研究人员在重写论文标题和摘要后再次测试了模型。他们完全改变了措辞,确保模型无法通过表面文本识别这些论文,但保留了其底层含义。模型的选择并未改变。它们仍然根据新的措辞选择了相同的论文,这证明它们的偏好植根于内容的含义,而非对著名标题的记忆。这表明,这些模型已经形成了一种趋同的、共享的直觉,用以界定什么是优秀的论文,这种直觉与人类专家评估相同工作的方式截然不同。
研究还探讨了当这些模型在时间维度上被重复使用时会发生什么。随着 AI 模型撰写新的论文,并且这些新论文被重新加入到未来的筛选池中,原始的真实论文变得越来越稀少。研究人员发现,随着真实论文的减少,模型对它们的引用变得更加密集,仿佛它们在为少数剩余的“优质”选项而竞争。然而,这并不意味着模型对整体真实文献的关注度提高了;事实上,流向真实论文的引用总份额显著下降了。模型只是将有限的注意力集中在不断缩减的“幸存者”群体上,创造了一个固定偏好遇到稀释目录的反馈循环。
这项研究表明,人工智能在科学领域的危险不仅在于它可能捏造虚假事实,更在于它可能会在无形中就一套狭隘的“正确”答案达成共识,从而忽略了该领域的其他部分。即使每个选项都是真实的,且每篇论文的可见度都相等,这些系统也会施加一个共同的过滤器来限制科学关注度。将不同的模型混合在一起并不能解决问题,因为它们都拥有相同的底层偏见。作者认为,解决方案需要改变这个共享的偏好图谱,而不仅仅是尝试实现信息来源的多样化。机器不仅仅是在阅读文献;它们正在开始决定文献的内容,而且它们都在做出同样的决定。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。