What Citations Get Wrong: A Full-Corpus Audit of Reference Existence and Claim Support in a Major NLP Conference
本文通过对 ACL 2026 会议论文集的审计发现,尽管几乎所有引用的参考文献均真实存在,但由于未记录的模型配置导致单次运行的自动化断言支持审计无法复现,这表明严谨的引用验证需要严格的操作日志记录以确保可复现性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学的宏大图书馆中,引用不仅仅是列表中的一个名字,它更是一种承诺。当作者写下一个句子并指向另一篇论文时,他们做出了两个截然不同的承诺。首先,他们承诺所指向的论文确实存在且可以被找到。其次,也是更难验证的一点,他们承诺所指向的论文确实表达了作者声称的内容。几十年来,科学界主要担心第一个承诺,尤其是在人工智能兴起之后。人们日益担心计算机程序正在编造虚假的论文,在参考文献列表中填入从未存在过的标题和作者,从而有效地用虚构内容污染学术记录。这种焦虑声很大,但支持它的证据却很薄弱。与此同时,第二个承诺——即主张本身的准确性——受到的关注要少得多,尽管它是检验一位科学家是否对其来源进行真实陈述的更古老、更根本的测试。
一位名叫陶安(Tao An)的研究人员决定同时测试这两个承诺,他并非针对一个小样本,而是针对一整年某顶级计算机科学会议的论文。研究团队审计了 2026 年计算语言学协会(ACL)论文集中的每一条参考文献,这一集合包含了近 4,500 篇论文和超过 200,000 条引用,以检查它们是否指向真实的文档。对于这些引用的一个较小的抽样子集,他们还检查了文档是否确实支持了引用它的那个句子。其目标是观察对 AI 生成虚假参考文献的担忧是否基于现实,并衡量作者误传其来源内容的频率。
调查从第一个承诺开始:存在性。研究人员构建了一个系统来检查每一条引用是否都指向一项真实的、可检索的作品。他们发现绝大多数引用(约 91%)都成功指向了真实的文献。那些未能匹配的少量引用并非都是伪造的论文;它们是一些诸如博客文章、软件文档或由于计算机误读文本而导致的解析错误。当团队手动审查那极小部分看起来可疑的引用时,他们发现近 21 万条引用中仅有两处被证实为完全不存在的论文。这一结果表明,在这个主要的平台上,关于 AI 填充虚假论文的恐惧在很大程度上是缺乏根据的。参考文献几乎总是真实的。
然而,当研究人员转向第二个承诺——即被引用的论文是否确实支持了该主张时,情况发生了彻底的变化。这是一项更艰巨的任务,要求系统阅读被引用的论文并将其与引用它的句子进行对比。团队使用了一个涉及计算机模型的两阶段过程来标记那些似乎误传了来源的引用。在第一次尝试中,系统标记了极少量的错误,这表明作者们大多是准确的。但是,当研究人员使用完全相同的计算机代码和相同的论文再次运行该过程时,结果却大相径庭。第二次和第三次运行发现的错误数量大约是第一次运行的六倍。
这种不一致性成为了这项研究最重要的发现。研究人员将原因追溯到了一个隐藏变量:用于做出初始判断的具体计算机模型并未被记录下来。在第一次运行中,系统在后台默认使用了一个较弱的模型,从而漏掉了许多错误。而在随后的运行中,使用的是一个不同的、更强大的模型,它捕捉到了更多的错误。由于第一次运行使用了一个从未记录的模型,研究人员无法确定第一次结果究竟测量了什么。教训是深刻的:无论经过多少次人工核查,如果过程无法使用完全相同的工具进行重复,那么单次的自动化审计是不可信的。测量本身是不稳定的。
当研究人员查看可以复制的数据时,他们发现错误是真实的,但并不是人们所担心的那种机器生成的胡言乱语。被证实的错误是微妙的人为错误。一位作者引用了一篇真实的论文,却声称其表达了与原意相反的观点,或者在原论文仅支持狭隘结论的情况下,引用了一个宽泛的发现。这些不是人工智能产生的幻觉,而是疲惫的研究人员在赶进度完成手稿时可能犯下的错误。对于任何仅检查引用是否存在之工具来说,这些错误都是不可见的,因为论文是真的,但主张与来源之间的联系断裂了。
研究还显示,同行评审过程(即其他科学家在论文发表前进行检查的过程)似乎并未能发现这些支持性错误。当团队将已发表的会议论文与一组未经评审的草稿进行对比时,引用错误的发生率在统计学上是相同的。这表明目前的同行评审制度并非旨在检查每一条引用与其来源的匹配度,因为这对志愿者评审员来说会耗费过多的时间。相反,确保引用确实支持其主张的责任很可能落在作者本人身上,即在提交作品之前。
最终,这项审计清晰地描绘了问题所在。科学记录正被虚假、不存在的论文淹没的担忧并没有得到数据的支持;参考文献几乎总是真实的。真正的问题在于与这些参考文献相关联的主张的准确性。这些错误是微妙的、人为的,且难以通过自动检测,因为用于寻找它们的工具尚不够稳定,无法给出一个单一、可靠的数值。研究结论指出,在我们能够信任机器来监管科学完整性之前,我们必须首先确保机器本身是连贯的,并且自身的错误也得到了充分理解。现存的缺陷并非是系统在人工智能压力下崩溃的迹象,而是对人类学术复杂性持久性的提醒。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。