← 最新论文
💻 computer science

Dual-Confidence Contrastive Decoding for Retrieval-Augmented Generation

本文介绍了双重置信度对比解码(DCCD),这是一种无需训练的方法,它通过利用文档级和标记级置信度信号,解决了多文档检索增强生成中的上下文内冲突,并在新的 DRQA 基准测试和标准问答数据集上验证了其有效性。

原作者: Raymond Li, Md Tawkat Islam Khondaker, Amirhossein Abaskohi, Gabriel Murray, Giuseppe Carenini, Issam H. Laradji

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Raymond Li, Md Tawkat Islam Khondaker, Amirhossein Abaskohi, Gabriel Murray, Giuseppe Carenini, Issam H. Laradji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名正在试图破解谜题的侦探。你手里有一叠关于发生了什么的五份不同的证人陈述(即“检索到的文档”)。

  • 证人 A 说的是真话。
  • 证人 B 在撒谎,但听起来非常有说服力。
  • 证人 C 说的是真话,但那是关于去年发生的事情,而不是今天。
  • 证人 D 在谈论一件完全不同的罪案。
  • 证人 E 只是在胡言乱语。

你的任务是仅根据这些陈述来编写一份最终报告。问题在于,你的大脑(AI 模型)也有它对过去类似案例的“记忆”。有时,你的大脑会想要忽略证人,而是根据它已有的知识进行猜测。有时,即使你听取了证人的话,你也可能会因为他们互相矛盾而感到困惑。

这篇论文介绍了一种让侦探(AI)处理这堆混乱证据的新方法,而无需重新学习(重新训练模型)。他们称之为 双重置信度对比解码(Dual-Confidence Contrastive Decoding, DCCD)

以下是它的工作原理,通过简单的部分进行拆解:

1. 新的“谜题”测试:DRQA

首先,作者意识到现有的 AI 测试不够难。大多数测试使用公开事实(如“谁是总统?”),这些是 AI 可能已经知道的信息。

因此,他们创建了一个名为 DRQA(深度研究问答)的新测试。

  • 类比: 想象 AI 是一个秘密公司的职员。问题是关于公司内部秘密的(例如“上季度我们在咖啡豆上节省了多少钱?”)。AI 从未见过 这些信息。
  • 陷阱: 给 AI 一个文件夹的文档。其中一个包含正确答案。其他的包含错误答案、过时的答案或胡言乱语。AI 必须 找到正确的文档来回答问题。如果它根据自己的记忆进行猜测,它会失败,因为答案并不存在于它的记忆中。

2. 解决方案:“双重检查”系统 (DCCD)

作者提出了一种不需要重新训练 AI 的方法。相反,它改变了 AI 在编写答案时,逐词思考的方式。

他们使用了两种类型的“置信度”检查,就像侦探使用两种不同的工具一样:

工具 A:文档级置信度(“这个文件有用吗?”检查)

在 AI 开始写作之前,它查看文件夹中的每个文档,并询问:“这个特定文档是否真的包含足够的信息来回答问题?”

  • 类比: 这就像是在检查证人是否甚至在谈论正确的罪案。如果文档是关于“咖啡豆”的,但问题是关于“服务器崩溃”的,那么置信度得分就很低。如果文档看起来包含答案,得分就会很高。

工具 B:Token 级置信度(“我对下一个词确定吗?”检查)

当 AI 开始编写答案时,它观察自己正在使用的当前文档,并询问:“如果我继续使用这个文档,我对即将输入的下一个词有信心吗?”

  • 类比: 想象你正在阅读一份证人陈述。如果陈述很清晰,你可以很容易地预测下一个词(“嫌疑人跑了……”)。如果陈述很混乱或有矛盾,你可能会犹豫(“嫌疑人跑了……或者可能是走……”)。这个工具衡量了这种犹豫。

3. 神奇的一步: “对比” (The Contrast)

最聪明的部分在于。AI 不仅仅是挑选“最好的”文档。它在玩一场 拔河比赛

  1. 它找到在两项检查中得分都最高的文档(“好证人”)。
  2. 它找到在两项检查中得分都最低的文档(“坏证人”或撒谎者)。
  3. 它计算 差距(边际值)——即“好证人”与“坏证人”之间的差异。
  4. 决策: 它获取当前的猜测,并将其强烈地 推向 “好证人”,同时将其 拉离 “坏证人”。两者之间的差距越大,它推的力量就越大。

简单来说: AI 在说:“我 90% 确定文档 A 是正确的,而我 10% 确定文档 B 是错误的。所以,我要忽略文档 B,并加倍关注文档 A。”

4. 为什么这很重要

论文表明,当 AI 面临一堆相互冲突、充满噪声或过时的文档(如他们在新的 DRQA 测试中所做的)时,这种“双重检查”方法比以往的方法效果要好得多。

  • 旧方法 经常会被撒谎者或过时的信息搞混,然后直接进行猜测。
  • DCCD 能够成功识别出“好证人”并忽略“坏证人”,即使那个“坏证人”听起来非常有说服力。

总结

这篇论文关于如何教 AI 成为一名更好的侦探,使其在面对一堆相互冲突的证据时能够做出选择。它不再仅仅是猜测或盲目信任它所读到的内容,而是使用两步置信度检查

  1. 这个来源是否有帮助?(文档级)
  2. 这个来源是否让我对下一个词感到确定?(Token 级)

通过将“最好的”来源与“最差的”来源进行对比并放大差异,AI 可以穿透噪音并找到真相,即使真相隐藏在一堆混乱且相互冲突的文件之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →