← 最新论文
🤖 AI

Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models

本文提出了 RUDDER,这是一种低开销框架,通过将源自预填充残差更新的自适应、基于证据的视觉锚点注入解码过程,以减轻大型视觉 - 语言模型中的幻觉问题,在保持各种架构下高吞吐量的同时显著降低了幻觉率。

原作者: Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手,它会查看图片并大声描述出来。这个机器人很棒,但它有一个有趣的习惯:有时,它对自己的“词语联想”过于自信,以至于开始编造内容。

例如,如果你给它看一张桌子上放着一本书的图片,它可能会说:“桌子上有一本书和一个杯子。”尽管图片中根本没有杯子,但机器人知道“书”和“杯子”在故事中经常成对出现,因此它产生了幻觉(想象)出了那个杯子。

发生这种情况是因为,随着机器人开始说话,对实际图片的记忆开始淡化,就像背景中的歌曲逐渐变轻,而机器人内部的声音却变得越来越响亮。

这篇论文介绍了一种名为RUDDER的新方法,可以在不拖慢机器人速度的情况下解决这一问题。以下是其工作原理,使用简单的类比来说明:

1. 问题:逐渐消失的锚点

将机器人看到的图片想象成一个将其固定在现实中的锚点

  • 问题所在:随着机器人开始说话,这个锚点被拖离了原位。机器人不再查看图片,而是开始根据它认为应该存在的内容进行猜测。
  • 旧方案:以前的方法试图通过让机器人停下来、重新阅读图片并再次尝试来解决这个问题。这就像要求学生停止写论文,走回图书馆重读那本书,然后再继续。这虽然有效,但耗时极长且非常缓慢。

2. 解决方案:RUDDER(“视觉锚点”系统)

RUDDER 是一种巧妙的方法,可以在不让机器人停下来或重新阅读图片的情况下,将锚点牢牢系在机器人手上。它分两步完成:

步骤 A:“快照”(CARD)

在机器人开始说话之前,它会快速、一次性地“快照”图片中最重要的细节。

  • 类比:想象机器人对图片拍了一张心理照片,并写下一句有力的话,精确总结图片中的内容。它称之为CARD(上下文激活残差方向)。
  • 其特殊之处:它在图片仍清晰存在于机器人脑海时获取这些信息。它不需要稍后再拍新照片;它只需像握指南针一样,紧紧抓住这个“证据方向”。

步骤 B:“智能门”(Beta Gate)

现在,随着机器人逐字说话,它需要知道何时使用那个指南针。

  • 旧方法的问题:如果你强迫机器人在每次说话时都查看指南针,那么当它只是在谈论语法或连接词(如“的”或“和”)时,可能会感到困惑。
  • RUDDER 的改进:RUDDER 使用一个Beta 门,它就像一个值得信赖的交通信号灯
    • 绿灯:如果机器人谈论的内容与图片相符(例如“一辆红色的车”),信号灯变绿。它表示:“很好,你走在正轨上!继续跟随指南针。”
    • 红灯:如果机器人谈论的内容与图片不符,或者只是在使用语法词,信号灯变红。它表示:“停!不要在这里强行套用图片细节;只需让句子自然流畅地继续。”

3. 为何这很重要

论文声称 RUDDER 是效率方面的“魔法”:

  • 无额外步骤:与其他让机器人重新阅读图片(这很慢)的方法不同,RUDDER 在单次通过中完成所有工作。这就像机器人边走边拿着指南针,而不是每走 10 步就停下来看地图。
  • 速度:它使机器人几乎保持原有的速度(原速度的 96%)。
  • 准确性:它成功阻止机器人在许多不同类型的机器人(模型)中编造物体(如那个假杯子),平均减少了约 24% 的此类错误。

总结

简而言之,RUDDER赋予机器人一个指南针(视觉证据)和一个智能交通信号灯(门),告诉它何时查看指南针,何时只需继续说话。这使机器人能够诚实地描述其所见,而不会让它变得缓慢或笨拙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →