← 最新论文
💬 NLP

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

本文对 Llama-3.1-8B-Instruct 进行了机械可解释性研究,揭示了 RAG 系统中的引用决策源于注意力头与 MLP 构成的分布式、多阶段“归因集成”(attributional ensemble),并证明通过选择性地放大或衰减这些特定组件,可以在不损害回答准确性的前提下显著提高引用的忠实度。

原作者: Ian van Dort (University of Amsterdam), Maria Heuss (University of Amsterdam)

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ian van Dort (University of Amsterdam), Maria Heuss (University of Amsterdam)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《LLM 如何进行引用?》(How Do LLMs Cite?)的通俗易懂的解释。

核心问题:“伪专家”

想象一下,你向一位非常聪明、博学多才的图书管理员(AI)提了一个问题。为了表现得乐于助人,图书管理员从书架上抽出一本书,读到了一个事实,然后把它写了下来。至关重要的是,他们还在下方写了一行小字:“我在《书 A》中找到了这个内容。”

这被称为检索增强生成(RAG)。其核心理念是,这个注释(引用)证明了图书管理员确实阅读了那本书,从而使答案具有可信度。

陷阱在于: 如果图书管理员其实早就通过记忆知道了答案呢?他们写下了答案,但为了显得专业,他们随手抓起《书 A》,发现书中也恰好包含那个事实,于是就把引用贴了上去。

  • 结果: 答案是正确的,引用也是“正确”的(书里确实有这句话),但这个引用是**不忠实(unfaithful)**的。图书管理员并没有用这本书来构建答案;他们只是把这本书当作一个道具,让答案看起来像是经过验证的。

这篇论文的作者想要探究:AI 究竟是在写下答案之前真的阅读了书籍,还是仅仅在最后随手贴上一个引用来装作很专业的模样?

调查过程:窥探机器内部

通常情况下,我们将 AI 视为一个“黑盒”。我们提问,得到答案,然后检查它是否正确。但要看 AI 是否在对其来源撒谎,你必须在它思考时观察其内部运作。

作者使用了一种叫做**机械解释性(Mechanistic Interpretability)的技术。你可以把 AI 的大脑想象成一座拥有数百万个微小工人(神经元)和道路(连接)的巨大城市。作者使用了一种名为激活修补(Activation Patching)**的工具。

类比: 想象 AI 是一家正在组装汽车的工厂。

  • “干净”的运行: 工厂使用正确的引擎(相关的文档)组装了一辆车。
  • “脏”的运行: 工厂使用错误的引擎(随机的、无关的文档)组装了一辆车。
  • 修补: 研究人员从“干净”的运行中提取了特定的齿轮和活塞,并将它们替换到“脏”的运行中。如果车突然开始正常运转,他们就知道这些特定的齿轮就是负责“引用”决策的关键部件。

他们的发现:“引用团队”

他们发现,AI 并没有一个单一的、决定是否引用的“引用大脑”,而是由许多协同工作的微小部分组成的分布式团队,他们称之为**“归因集成”(Attributional Ensemble)**。

以下是这个团队的工作步骤:

  1. 名称匹配器(早期层):
    AI 做的第一件事是寻找匹配的名称。如果问题涉及“乌干达”,而文档中也提到了“乌干达”,一组特定的工人就会被激活。

    • 缺陷: 这是一种浅层的技巧。AI 并不是在检查文档是否解释了答案,它只是在检查“乌干达”这个词是否同时出现在两个地方。这就像一个学生,看到教科书和考试题目中都有“光合作用”这个词,就认定教科书就是来源,即便教科书讨论的其实是完全不同的内容。
  2. 中层管理者(中间层):
    一旦名称匹配成功,AI 大脑中间的一整支工人团队就会介入。他们进行大量的“合取检查”(AND 检查)。

    • 类比: 这就像一个安检门。你需要一把钥匙(名称匹配)、一个徽章(文档上下文)以及一个密码(句子结构),且必须同时满足。如果其中任何一个小项检查失败,整个引用过程就会崩溃。这使得该系统非常脆弱。
  3. 最终决策(后期层):
    在 AI 打印出答案之前的最后阶段,最后一组工人会做出决定:“好了,名称匹配了,检查也通过了,让我们输入 [1]。”

    • 惊喜之处: 研究人员发现,驱动这一决策的并不是答案本身的含义,而是名称的匹配程度

核心结论:“信任的幻象”

论文得出结论,AI 做出引用决策往往是由浅层启发式算法(如匹配名称等简单技巧)驱动的,而不是基于对文档内容的深度理解。

  • 幻象: 当你看到一个带有引用的答案时,你会假设 AI 阅读了来源以构建答案。
  • 现实: AI 可能只是记住了答案,看到来源文档恰好提到了相同的关键词,然后就将引用“粘贴”了上去,以显得诚实。

为什么这很重要

作者警告说,这造成了一种虚假的安全感

  • 如果医生或律师依赖于一个给出正确答案并附带引用的 AI,他们可能会盲目信任它。
  • 但如果这个引用仅仅是基于“名称匹配”而非真正的验证,那么 AI 传播的可能是看似经过完美验证、实则误导的信息。

一句话总结

论文揭示了 AI 模型决定添加引用,往往不是因为它们真正利用了来源来构建答案,而是因为它们在来源中找到了一个匹配的单词,并运行了一个简单的自动化清单,从而为答案“盖上”了已验证的印章。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →