← 最新论文
💬 NLP

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

该论文提出了 EVisRAG,这是一个以证据为引导的框架,通过显式收集与问题相关的视觉证据,并采用一种新型的 RS-GRPO 算法来改进定位与推理的联合优化,从而缓解多图推理中的视觉幻觉问题,并在视觉问答基准测试中取得了显著的性能提升。

原作者: Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图解开一个谜团,但你拿到的不是单一的线索,而是一叠乱七八糟的三份不同报纸、照片和地图。你的口袋里有一个超级聪明的侦探——一个名为“视觉语言模型”(VLM)的计算机程序,它既能阅读文本,也能观察图片。这个侦探非常擅长回答问题,但当面对一大堆图像时,他们有时会感到困惑。他们可能会开始编造一些并未见到的细节,比如声称一张照片显示的是猫,而实际上是一只狗,或者把来自两个不同页面的事实混淆在一起。这被称为“视觉幻觉”。

为了帮助这些侦探,科学家们开发了一种名为“视觉检索增强生成”(Visual Retrieval-Augmented Generation, VRAG)的系统。你可以把它想象成给侦探办了一张图书证。当你提出问题时,系统会立即从图书馆中调取最相关的页面并递交给侦探。其核心理念是:如果侦探面前有正确的证据,他们就不需要靠猜测或编造来回答。然而,即使有了正确的页面,侦探也经常难以在嘈激的信息中找到那句确切的话或那张图片,或者他们可能会被无关细节分散注意力,从而仍然编造出一个答案。大问题在于:我们如何教导这位侦探成为一名真正的调查员,让他们仔细扫描每一页,只写下他们实际看到的实事,然后通过推理而非猜测来破解谜团?

这正是论文《VisRAG 2.0》(特别是 EVisRAG 框架)旨在解决的问题。作者团队是由来自中国的大学研究人员组成的,他们提出了一种新的方法来训练这些 AI 侦探,让他们停止幻觉,开始利用真实证据进行推理。他们发现,以往的方法就像是给侦探一叠纸并说:“你自己搞定吧!”这往往会导致混乱。相反,EVisRIG 强制模型扮演一名细致入微的侦探,遵循严格的三步走流程:观察(Observe)、记录(Record)和推理(Reason)

首先,模型观察检索到的图像,并逐页明确说明它看到了什么。其次,它创建一个“证据日志”,写下来自每张图像的具体事实,并且至关重要的一点是,还要注明哪些图像中没有有用的信息。最后,它仅使用这份书面日志来解决问题。为了确保模型确实学会了这种行为,研究人员发明了一种新的训练方法,称为 RS-GRPO(奖励范围组相对策略优化,Reward-Scoped Group Relative Policy Optimization)。你可以把它想象成一位非常严厉的教练,这位教练不仅仅根据最终答案给出一个分数,而是会给出两项独立的评分:一项是“你是否看了正确的图片?”,另一项是“你是否正确地记录了事实?”。这防止了模型仅仅因为靠运气猜对了答案而获得高分,从而确保它真正学会了先寻找证据。

这种新方法的实验结果非常令人印象深刻。在各种视觉问答基准测试(如阅读图表、文档和幻灯片)中,EVisRAG 模型在准确率上平均比标准的“骨干”模型高出约 19%。更重要的是,它显著减少了模型编造事实的情况。在一次特定的测试中,标准模型可能会看着一张图表,自信地断言错误的国家人口更多,因为它幻觉出了一个数字。然而,EVisRAG 会观察图表,将正确的数字写进它的证据日志,然后正确地推导出答案。

该论文还反对认为仅仅让模型“思考得更久”或增加更复杂的智能体(agents)就是最佳解决方案的观点。相反,他们证明了结合他们特定的训练方法(RS-GRPO)的一种结构化、证据引导的方法更为有效。他们展示了通过限定奖励的范围——即只在正确的时刻给予正确的行动以信用——模型会变得更加稳定和可靠。虽然论文并未声称这解决了 AI 可能面临的所有问题,但实验表明,这种方法是让视觉 AI 系统变得更加值得信赖、准确且不易在观察多张图像时信口开河的一个重大进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →