← 最新论文
💬 NLP

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

SIRA 是一种无需训练的内部对比解码框架,它通过在同一个 Transformer 的后续层中利用掩码注意力机制生成以语言先验为主导的反事实参考,从而减轻大型视觉 - 语言模型中的幻觉问题,在保持描述覆盖度的同时减少对外部工具和额外前向传播的依赖。

原作者: Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博览群书的助手(大型视觉 - 语言模型),他正试图描述你刚刚展示给他的一张照片。有时,这位助手会对自己“认为”看到的内容过于自信,而不是基于实际存在的内容。他们可能会说:“我看到一辆红色的自行车”,而实际上照片中只是一个模糊的形状,可能是自行车;或者,因为他们读过太多关于自行车的故事,大脑会自动填补空白,从而编造细节。这被称为幻觉

本文介绍了一种巧妙的新技术,称为SIRA,旨在阻止这种现象发生,而无需重新训练助手,也无需雇佣第二人来复核工作。

旧方法的缺陷

此前,为了防止助手撒谎,研究人员尝试过这样的方法:

  1. 向助手展示原始图片。
  2. 然后,向他们展示同一张图片的模糊或损坏版本
  3. 比较两个回答。如果助手在图片模糊时改变了说法,那么他们可能是在猜测。

缺陷在于: 这就像先让人描述一幅画,然后让人戴着雾蒙蒙的眼镜描述同一幅画。“雾镜”版本并非公平的对比,因为眼镜本身就会扭曲图像。这种方法既混乱,又耗时加倍(你需要分两次查看图片),而且扭曲本身可能会产生新的错误。

SIRA 解决方案:“共享前缀”

SIRA 采取了不同的方法。它不是去扭曲图片,而是在助手思考过程中、在他们仍在思考时,对其内部思维过程进行干预。

将助手的思维想象成一条拥有多个站点(层)的工厂流水线,这些站点正在处理图像和问题。

  1. 共享起点: 助手首先同时查看图片和问题。他们在流水线的早期站点建立起对场景的扎实理解。这就是“共享前缀”。SIRA 确保助手的两个版本在这一初始理解上达成一致。
  2. 分岔路口: 在形成初始理解之后,SIRA 将过程在同一个大脑内部拆分为两条并行轨道:
    • 轨道 A(完整视角): 助手在说完句子时,继续查看图片细节。
    • 轨道 B(“盲视”视角): 助手从完全相同的起点继续,但在后期站点中,他们被蒙住双眼,无法看到具体的图片细节。他们只能依赖其通用知识和已经写出的句子。

如何纠正谎言

现在,SIRA 在撰写句子的每一步都对比这两条轨道:

  • 如果助手说:“我看到一只",而轨道 A(看到狗)和轨道 B(蒙眼)都以高置信度说“狗”,SIRA 就知道这很可能只是基于常见语言的猜测(也许狗在故事中很常见)。它会降低“狗”的得分,因为蒙眼版本不需要图片也能说出这个词。
  • 如果助手说:“我看到一只紫色大象",而轨道 A 说“紫色大象”(因为他们看到了),但轨道 B 说“不可能,故事里没有这个”(因为他们看不见),SIRA 就知道图片是这一说法的唯一原因。它会提高“紫色大象”的得分。

为何更优

  • 无需额外步骤: 它不需要两次查看图片。它只需拆分内部思维过程,一次性完成所有操作。
  • 无混乱扭曲: 它不会模糊图片。它只是暂时“关闭”其中一种思维过程的视觉输入,同时保持其余上下文的完美对齐。
  • 无需训练: 它可直接应用于现有模型。你无需教模型任何新内容。

结果

在测试中,SIRA 成功阻止了助手编造照片中不存在的物体(例如照片中并没有的“香蕉”),同时仍能让他们准确描述真实存在的物体。这就像在模型自身的思维内部内置了一个即时发生的“现实核查”机制,确保他们所说的内容确实由所见所支持,而不仅仅是他们预期会看到的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →