← 最新论文
💬 NLP

How Retrieved Context Shapes Internal Representations in RAG

本文通过研究检索增强生成(RAG)中不同相关性文档对大型语言模型内部隐藏状态的影响,揭示了上下文相关性如何塑造模型表征并进而决定其生成行为,为 RAG 系统设计提供了新见解。

原作者: Samuel Yeh, Sharon Li

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Yeh, Sharon Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次对大语言模型(LLM)大脑内部的“深度体检”。

想象一下,检索增强生成(RAG) 就像是你请了一位博学但有点固执的顾问(大模型)来帮你回答问题。为了让他回答得更准,你不仅让他用自己的脑子想,还给他提供了一堆参考资料(检索到的文档)。

以前的研究主要看这位顾问最后给出的答案对不对。但这篇论文的作者(Samuel Yeh 和 Sharon Li)觉得不够,他们想看看:当顾问阅读这些资料时,他脑子里的“想法”到底发生了什么变化?

为了让你更容易理解,我们把整个过程比作**“侦探破案”**:

1. 核心发现:资料的质量决定了侦探的“脑回路”

作者把资料分成了三类,并观察侦探(模型)看到它们时的反应:

A. 随机资料(Random Documents)= 毫无关系的八卦

  • 场景:你问“谁在 1967 年蒙特雷流行音乐节上烧了吉他?”,资料里却全是关于“沃伦·比蒂的电影”或“毫无关联的食谱”。
  • 侦探的反应
    • 直觉:你可能会觉得侦探会忽略这些废话。
    • 真相:大模型非常敏感。一旦看到这种完全无关的“噪音”,他的大脑内部状态会发生剧烈的震荡(Representation Drift)。
    • 结果:这种震荡其实是一种自我保护机制。模型意识到“这资料没法帮我破案”,于是它选择**“放弃回答”**(Abstain),直接说“我不知道”或“资料不够”。
    • 比喻:就像侦探看到一堆乱码,直接把手里的案子扔了,说:“这案子没法查,我不接了。”
    • 副作用:有时候,即使侦探自己脑子里本来就有答案(比如他知道吉米·亨德里克斯烧吉他),但因为资料太烂,他反而不敢回答自己知道的东西了。

B. 相关但无用的资料(Distracting Documents)= 似是而非的假线索

  • 场景:资料里提到了"1967 年”、“蒙特雷音乐节”,但主角却是别人,或者根本没提烧吉他的事。
  • 侦探的反应
    • 这种资料最狡猾。它看起来很像真的,但其实是误导。
    • 结果:模型很难区分这是“真线索”还是“假线索”。这会导致模型在“相信自己的记忆”和“相信资料”之间打架,最后往往答错或者犹豫不决

C. 真正相关的资料(Relevant Documents)= 确凿的证据

  • 场景:资料里明确写着“吉米·亨德里克斯烧了吉他”。
  • 侦探的反应
    • 直觉:你可能会觉得,有了新证据,侦探的脑子应该发生翻天覆地的变化。
    • 真相:恰恰相反!当资料是简单问题(模型本来就知道答案)时,看到相关证据,侦探的大脑状态几乎没变
    • 比喻:这就像你本来就知道“地球是圆的”,然后有人给你看一张地球的照片。你的脑子里并没有发生剧烈的重组,这张照片只是确认了你原本的想法,让你更有信心了。
    • 局限:如果是很难的问题(模型本来不知道),即使给了相关证据,模型的大脑状态也很难被彻底改变。它还是倾向于相信自己原本那一点点模糊的记忆,导致 RAG 在解决难题时效果有限。

2. 侦探的“思考过程”:层层递进

作者还观察了侦探思考的不同阶段(对应模型的神经网络层):

  • 早期阶段(浅层):侦探很快就能识别出“随机资料”(那些完全无关的八卦),把它们标记为“噪音”。
  • 晚期阶段(深层):这是最关键的。当侦探读到相关证据时,他并没有完全被证据带走。相反,越往深层思考,他越依赖自己原本脑子里的知识(参数化知识)
    • 比喻:就像你读了一篇文章,刚开始觉得“哇,这观点很新”,但读到最后,你发现“嗯,这其实和我原本的想法差不多”。
    • 后果:这意味着,对于很难的问题,如果模型自己本来不知道,光靠给资料,可能很难让它真正“学会”新东西,因为它太固执于自己原本的知识了。

3. 多文档环境:一个好人能镇住一群坏人

在现实场景中,你给侦探的资料往往是混合的(既有真的,也有假的,还有瞎扯的)。

  • 发现:只要资料堆里有一篇是真正相关的(哪怕其他 19 篇都是垃圾),侦探就能稳住阵脚
  • 比喻:就像在一个嘈杂的房间里,只要有一个声音清晰、正确的人在说话,侦探就能听清那个声音,而忽略周围的噪音。
  • 启示:这对系统设计很有用。我们不需要把资料过滤得完美无缺,只要保证检索回来的资料里至少有一篇是真的,模型就能发挥得很好。

总结:这篇论文告诉我们什么?

  1. 模型很聪明,也很“洁癖”:如果资料太烂(随机),模型会直接拒绝回答,而不是瞎编。
  2. 模型有点“固执”:如果资料是真的,但问题很难,模型往往还是更相信自己原本的知识,而不是完全采纳资料。
  3. 不需要过度清洗:只要保证资料库里有真货,哪怕混着很多垃圾,模型也能自己把真货挑出来用。

一句话总结
这篇论文通过观察大模型“大脑内部”的变化,揭示了它如何处理外部信息。它告诉我们:给模型看垃圾,它会闭嘴;给模型看真货,它会更有信心;但如果是很难的题,光给资料可能还不够,因为模型太依赖自己原本的记忆了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →