← 最新论文
🤖 AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

该论文提出了一种名为残差解码(ResDec)的无训练新方法,通过利用历史信息和模型内部的隐式推理机制来纠正语言先验偏差,从而有效抑制大型视觉语言模型中的幻觉现象并提升视觉定位能力。

原作者: Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为**“残差解码”(Residual Decoding,简称 ResDec)的新方法,旨在解决大型视觉 - 语言模型(LVLM)中一个令人头疼的问题:“幻觉”**。

为了让你轻松理解,我们可以把这篇论文的核心思想拆解成几个生动的比喻。

1. 什么是“幻觉”?(模型在“脑补”)

想象一下,你让一个**“博学但有点爱瞎想的朋友”**(这就是大型视觉 - 语言模型)看一张照片,然后让他描述照片里有什么。

  • 照片内容:一张只有3 根香蕉的照片。
  • 朋友的反应:他看着照片,嘴里说着:“嗯,这里有很多香蕉……"然后突然自信地开始编造:“看,那边还有两根,一共 5 根!而且它们看起来像是刚被猴子吃了一半。”

问题出在哪?
其实照片里只有 3 根。但他之所以编造出"5 根”和“猴子”,是因为他脑子里的**“语言习惯”**(Language Priors)太强了。

  • 他可能以前看过很多关于“香蕉”的文章,里面常提到“很多香蕉”或“猴子吃香蕉”。
  • 在描述过程中,他的语言逻辑逐渐盖过了视觉事实。就像他一边看图,一边脑子里在背课文,背着背著,课文内容就取代了眼前的真实景象。

这就是**“幻觉”**:生成的内容语法通顺、逻辑自洽,但跟图片完全对不上号。

2. 以前的方法太“重”了(笨重的修正方案)

为了解决这个问题,以前的科学家尝试过两种方法,但都有缺点:

  • 重新训练(Training-based):就像让这位朋友去上“诚实特训营”,重新学习怎么看图说话。但这需要大量的时间和金钱,而且每次模型升级都要重新特训,太贵了。
  • 强行干预(Training-free but heavy):就像在他说话时,安排一个**“双倍的影子”**在旁边实时对比。如果他说错了,影子就立刻纠正。但这会让说话速度变慢一倍,而且非常消耗精力(计算资源)。

3. ResDec 是什么?(聪明的“后视镜”策略)

这篇论文提出的 ResDec,不需要重新训练,也不需要双倍精力。它就像给这位朋友装了一个**“智能后视镜”**。

核心发现:答案早就藏在“过程”里

研究人员发现了一个有趣的现象:
当这位朋友在描述图片时,虽然他在最后说出答案(比如"3 根”)之前,可能会因为“瞎想”而犹豫或偏离,但在他说话的中间过程(比如他说“让我数一下……"、“看起来像……"这些铺垫词时),他的**潜意识(内部逻辑)**其实早就已经“知道”正确答案了。

  • 比喻:就像你开车时,虽然你嘴上在犹豫“前面是不是有红灯?”,但在你大脑的前几毫秒,你的眼睛其实已经捕捉到了红灯的信号。只是后来你的“语言习惯”(比如“通常这里没红灯”)干扰了你,让你差点说错。

ResDec 的工作原理:

  1. 观察“后视镜”:ResDec 会回顾朋友刚才说过的几句话(历史 Token)。
  2. 寻找“稳定期”:它发现,在朋友刚开始描述时,脑子有点乱(混乱期);在描述快结束时,他又开始为了凑字数而发散思维(发散期)。但在中间某个阶段,他的逻辑是最清晰、最稳定的(锚定期)。
  3. 提取“潜台词”:ResDec 专门提取这个“稳定期”里朋友潜意识里的真实想法(那些还没被语言习惯带偏的线索)。
  4. 混合修正:在朋友要说出最终答案的那一刻,ResDec 悄悄地把这些“潜台词”加进去,像给咖啡加了一点糖,中和掉那些“瞎想”的苦涩。

结果:朋友依然说话流利,但不再被语言习惯带偏,而是紧紧抓住了图片里的真实信息。

4. 这个方法好在哪里?

  • 不用重新上学:不需要训练,直接给现有的模型装上这个“插件”就能用。
  • 不费脑子:不需要双倍计算量,速度几乎和原来一样快。
  • 效果显著
    • POPE(物体幻觉测试)等 benchmarks 上,准确率大幅提升。
    • CHAIR(描述幻觉测试)上,编造不存在的物体(比如不存在的猴子、不存在的第 4 根香蕉)的情况大幅减少。
    • 不仅减少了幻觉,还让模型在复杂的推理任务上表现更好。

总结

这篇论文就像是在告诉我们要**“相信过程,修正结果”**。

大型模型之所以会“幻觉”,是因为它们在说话的过程中,语言习惯逐渐淹没了视觉事实。ResDec 就像是一个聪明的**“时间旅行者”,它回到模型说话的前几秒,提取出那些最真实、最未被污染的线索**,然后在最后关头把这些线索“注入”到模型的回答中。

这就好比给一个爱做梦的画家,在落笔定稿前,轻轻提醒他一句:“嘿,别忘了你刚才看到的真实颜色。”于是,画作既保留了艺术性,又还原了真实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →