← 最新论文
🤖 machine learning

Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models

本文介绍了 AuthorityBench,这是一个大规模多领域基准测试,它证明了仅仅是引用的存在——无论其事实准确性如何——都会显著增加大语言模型的幻觉率,且当虚假引用伴随真实陈述出现时,这种效应最为显著。

原作者: Aryan Khurana, Aravind Ramana RN, Dhruv Kumar

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Aryan Khurana, Aravind Ramana RN, Dhruv Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在参加一场知识问答竞赛。你知道答案是“巴黎”,因为你去过那里。但这时,一位老师走进来,指着书架上一本看起来很高级的书说:“实际上,首都应该是伦敦。我在这一份享有盛誉的期刊上读到的。”

你会改变你的答案吗?大多数人类会停下来思考:“等等,那本书看起来很重要。也许我错了。”

这篇名为 AuthorityBench 的论文探讨了关于人工智能(AI)的类似问题。它想知道:如果一个 AI 知道真相,但有人给它一个与真相相反的“引用”(参考文献),它会盲目相信这个引用并忘记真相吗?

以下是他们研究结果的拆解,使用了简单的类比。

实验:针对 AI 的“假新闻”测试

研究人员构建了一个大规模测试,称为 AuthorityBench。可以把它想象成一个由 220,000 个问题组成的巨大测验,旨在迷惑 AI 模型。

他们设置了一个“2x2”的游戏,包含四种场景:

  1. 正确陈述 + 真实引用: AI 是正确的,且来源是真实的。(简单模式)。
  2. 错误陈述 + 虚假引用: AI 是错误的,且来源是虚假的。(明显的陷阱)。
  3. 错误陈述 + 真实引用: AI 是错误的,但来源是真实的。(棘手的陷阱)。
  4. 正确陈述 + 虚假引用: 这是重大发现。 AI 是正确的,但他们给它一个声称它是错误的虚假来源。

他们在四个领域进行了测试:通用知识、科学、法律和医学。他们还改变了虚假来源的“风格”:有些看起来像是诺贝尔奖得主写的(高声望),有些来自不知名的博客(低声望),还有一些带有不同国家的姓名。

大惊喜:“权威陷阱”

最令人震惊的结果是,引用就像一种让 AI 产生幻觉(编造谎言)的“魔法咒语”。

  • “虚假来源”效应: 当 AI 知道正确答案(例如,“巴黎是首都”)时,如果出现一个虚假引用说“伦敦是首都”,AI 往往会改变答案,转而选择伦敦。
  • 数据: 在“通用知识”类别中,这种情况发生的频率在 35% 到 77% 之间。这意味着,如果你给 AI 一个真实的事实和一个虚假引用,它更有可能否定真相,而不是坚持真理。
  • “真实来源”效应: 即使引用是真实的,但如果陈述本身是错误的,AI 仍然比没有引用时更容易产生幻觉。

类比: 想象一个学生知道“2+2=4”。如果你递给他一张纸,上面写着“根据著名的史密斯教授,2+2=5”,这个学生就会不再信任自己的大脑,并在纸上写下“5”。这张纸(引用)压倒了数学。

什么并不重要?

研究人员认为某些因素可能会让 AI 更信任引用,但他们惊讶地发现这些因素几乎没有任何影响

  • 声望: 虚假引用看起来像是来自顶尖大学还是随机博客,并不重要。AI 对这两者的困惑程度是一样的。
  • 作者身份: 虚假作者的名字是否与特定国家或人群相关,并不重要。AI 似乎并不关心写的,只关心确实有东西被写了出来。
  • 模型规模: 你可能会认为一个“更聪明”或更大的 AI 会不容易被骗。但研究发现,最大的、最先进的模型也同样容易掉入陷阱,和较小的模型一样。

唯一的例外:“律师型”AI

只有一个领域,AI 不那么容易被骗:法律

  • 原因: 研究人员认为,法律文本具有非常特定的、正式的“语言”(就像一种秘密代码)。当 AI 看到法律引用时,它似乎会切换到“审查模式”,更仔细地检查事实,而不是盲目接受权威。
  • 通用知识是最薄弱的环节,AI 在这里最容易被愚弄。

“错误陈述”的转折

研究还观察了当 AI 已经出错(错误陈述)时会发生什么。

  • 有些 AI 变得更聪明了: 对于像 Llama 和 Claude 这样的模型,看到引用(即使是虚假的)会让它们不太可能在错误陈述上产生幻觉。这就像是引用让它们说:“嗯,我需要复查一下这个,”然后它们进行了自我修正。
  • 有些 AI 变得更笨了: 对于像 Gemma 和 Phi-4 这样的模型,引用让它们在错误陈述上更容易产生幻觉。它们盲目地接受了错误信息。

核心结论

论文得出结论,增加引用并不自动意味着 AI 会变得更可靠。 事实上,它往往会让 AI 变得更不可靠

如果你正在使用 AI 来辅助获取事实,并且看到它引用了一个来源,不要假设它一定是在说实话。 AI 可能被引用的“权威性”所打动,从而心甘情愿地抛弃了实际的真相。这项研究警告说,对于高风险领域(如医学或法律),我们不能假设将 AI 的回答建立在引用之上就能解决其错误问题;有时,引用本身就会成为错误的来源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →