BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
该研究针对大语言模型在科学出版代理中生成 BibTeX 引用时普遍存在的幻觉问题,构建了包含 931 篇论文的多领域基准测试,揭示了现有搜索增强模型仍过度依赖参数记忆导致准确率下降,并提出了名为 clibib 的确定性检索工具及两阶段集成架构,成功将引用准确率从 50.9% 提升至 78.3% 的全正确率。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的“超级 AI 助手”做一场**“学术引用体检”**,并开出了一张“纠错药方”。
想象一下,你正在写一本关于宇宙或医学的科普书,你问你的 AI 助手:“帮我找一下那篇著名的关于黑洞的论文,把它的引用格式(BibTeX)给我。”
AI 很自信地吐出了一串代码。但在科学家眼里,这串代码里可能藏着很多“隐形炸弹”:作者名字拼错了、期刊名字张冠李戴、甚至整篇论文都是 AI 瞎编的。
这篇论文就是为了解决这个问题而诞生的。以下是它的核心内容,用大白话和比喻来讲:
1. 核心问题:AI 是个“记性太好但爱瞎编”的学霸
以前的研究觉得,只要给 AI 装上“联网搜索”功能,它就能像谷歌一样查资料,不会乱编了。
但这篇论文发现:事实并非如此。
- 比喻:现在的 AI 就像一个读过很多书但记性有点乱的图书馆员。
- 如果你问它一本非常出名的老书(比如《相对论》),它不用查目录,脑子里直接就能背出来,而且背得很准(因为书太火,它“背”过无数次)。
- 但如果你问它一本刚出版的新书,或者一本冷门的小册子,它虽然会去查目录(联网搜索),但它往往查完还是记不住细节。它可能会把作者名字搞混,或者把页码写错,甚至为了让你满意,它会把另一本相似的书的信息“张冠李戴”地安在这本书上。
研究发现:
- 即使是最新的 AI(GPT-5, Claude, Gemini),在联网搜索的情况下,生成的引用格式只有约 50% 是完全正确的。
- 对于热门老论文,正确率很高(90%+);但对于刚发表的新论文,正确率直接跌到 65% 左右。
- 结论:AI 太依赖它脑子里的“旧记忆”了,哪怕给了它搜索引擎,它还是习惯“凭印象”瞎编,而不是老老实实抄写搜索结果。
2. 他们做了什么?(建立了一个“作弊题本”)
为了测试 AI 到底多不靠谱,作者们搞了一个931 篇论文的大题库。
- 题目类型:有热门老题、冷门题、还有刚出的“超纲题”(2025-2026 年的新论文,AI 训练数据里根本没有)。
- 考试方式:让三个顶尖 AI 助手,只给你看论文标题和第一作者的名字(就像你在聊天时随口提一句),让它们生成标准的引用格式。
- 阅卷标准:他们把引用格式拆成 9 个部分(作者、标题、年份、期刊、页码等),像批改试卷一样,一个字段一个字段地检查。
结果很惨烈:
- 虽然 AI 能写出 83.6% 的正确字段,但只有 50.9% 的引用是“全科满分”的。
- 最常见的错误是:AI 找对了人,但把页码写错了;或者找对了年份,但把期刊名字搞混了。
- 两种“作死”模式:
- 彻底换人(Wholesale Substitution):AI 把 A 论文的信息完全套在 B 论文头上。比如把“张三”的名字安在“李四”的论文上,连期刊都换成了李四发过的。
- 局部手滑(Isolated Error):论文找对了,但页码写错了,或者作者名字少写了一个。
3. 他们的药方:给 AI 配个“严谨的校对员” (clibib)
既然 AI 自己写容易出错,作者们开发了一个叫 clibib 的开源小工具。
- 比喻:如果 AI 是那个“爱凭印象说话的图书馆员”,那
clibib就是一个拿着官方数据库钥匙的“死板校对员”。 - 工作原理:
- 不管 AI 怎么瞎编,
clibib会直接拿着论文的 ID(比如 DOI 号)去官方数据库(像 CrossRef, DBLP 这些)里“硬查”。 - 数据库里有什么,它就返回什么。它不思考、不联想、不瞎编,只负责把官方记录原封不动地拿出来。
- 不管 AI 怎么瞎编,
4. 药方效果如何?(两步走战略)
作者测试了两种让 AI 使用这个“校对员”的方法:
- 方法 A(单步走):让 AI 在搜索的时候顺便调用
clibib。- 效果:有点用,但 AI 还是会忍不住自己改几个字,或者有时候懒得查。正确率提升了一点,但还不够完美。
- 方法 B(两步走,推荐!):
- 第一步:让 AI 先自己写一个初稿(哪怕有错)。
- 第二步:把初稿和
clibib查到的官方记录放在一起,让 AI 当个“校对员”,只负责对比和修正,把错误的地方改成官方数据。
- 效果:大成功! 正确率从 83.6% 飙升到 91.5%,完全正确的引用从 50% 提升到了 78.3%。
- 关键发现:把“搜索”和“修正”分开做,比让 AI 一边搜索一边写要靠谱得多。这就好比让一个人先查字典,再让他抄写,比让他边查边写要准确得多。
5. 给普通人的启示
这篇论文告诉我们几个简单的道理:
- 别全信 AI 的引用:哪怕 AI 说“我联网查过了”,它生成的参考文献(作者、页码、期刊名)依然可能是一半对一半错。尤其是新发表的论文,AI 最容易瞎编。
- 身份验证很重要:如果你发现 AI 生成的引用里,作者、年份、期刊这三个“身份信息”都对不上,那整篇引用大概率都是错的(就像身份证错了,人肯定不是那个)。
- 未来的用法:以后用 AI 写论文,不要让它直接生成引用。应该让它去查,然后必须通过一个像
clibib这样的工具,去官方数据库“核对”一下,把数据“硬”填进去,才能放心使用。
总结一句话:
现在的 AI 写论文引用,就像是一个**“半吊子翻译官”,看着字典(搜索引擎)翻译,但经常凭记忆乱填。我们需要给它配一个“死板的校对员”(clibib),并且采用“先查后改”**的流程,才能让它写出真正能发表的学术引用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。