SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
SAVAA 是一个无需训练的框架,它通过引入视觉定位熵来估计令牌级幻觉风险,并在生成过程中自适应地调整视觉注意力放大因子,从而减轻大型视觉 - 语言模型中的幻觉问题,进而克服固定放大策略的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个非常聪明的机器人助手(大型视觉 - 语言模型,或称 LVLM),它会查看照片并向你描述。有时,这个机器人会变得过于自信,开始编造内容。它可能会说:“图片里有一只狗”,即使实际上并没有。这被称为幻觉。
机器人之所以这样做,是因为它过度依赖其关于世界通常样貌的“记忆”(语言先验),而不够重视它在特定时刻照片中实际看到的内容。
旧方法:“一刀切”的音量旋钮
最近,研究人员试图通过调高机器人“视觉注意力”的“音量”来解决这个问题。想象机器人有一个用于“看图片”的音量旋钮,另一个用于“听自己想法”的旋钮。
以往的方法使用固定音量旋钮。它们只是为机器人写的每一个词,以相同的幅度调高“看图片”的音量。
- 问题所在:这就像试图用同一个音量设置去听轻声细语和大声喊叫。
- 有时机器人需要更努力地看图片以阻止谎言,但固定音量太低(放大不足)。
- 其他时候,机器人已经看得很仔细,但音量被调得太高,导致它仅仅因为盯着看而开始“看到”不存在的东西(放大过度)。
该论文将这种情况称为**“双重失败模式”**:固定设置有时太弱,有时又太强。
新解决方案:SAVAA(智能自适应领航员)
作者提出了一种名为SAVAA(逐步自适应视觉注意力放大)的新方法。SAVAA 不像固定旋钮,它更像是一位智能领航员,逐词实时调整控制。
以下是其工作原理,分步说明:
1. “风险雷达”(视觉定位熵)
在机器人写下下一个词之前,SAVAA 会检查“风险雷达”,以判断机器人是否即将撒谎。它使用一种名为**视觉定位熵(VGE)**的特殊工具。
- 工作原理:它提出两个问题:
- 机器人是否不确定?(高不确定性 = 风险)。
- 机器人是否正在为这个词查看图片?(如果机器人很自信,但图片不支持该词,那就是巨大的风险)。
- 类比:想象机器人正在描述一个海滩。如果它说“沙子”,图片支持这一点,因此风险很低。如果它说“雪”(而图片明显是海滩),即使机器人对单词“雪”感到非常自信,风险也很高。
2. “动态音量旋钮”
基于风险雷达,SAVAA 为下一个词调整“看图片”的音量:
- 高风险:如果机器人即将说出一些有风险的内容,SAVAA 会调高视觉注意力。它迫使机器人在说话前仔细查看照片。
- 低风险:如果机器人是安全的,且图片明确支持该词,SAVAA 会调低音量。这防止机器人变得“过于强烈”并编造新细节。
3. 旧思维的“静音按钮”
有时,即使拥有完美的视觉焦点,机器人仍然过度依赖其内部的“讲故事”习惯。为了解决这个问题,SAVAA 添加了一个文本注意力抑制功能。
- 类比:想象机器人试图描述一张照片,但它不断被背景中播放故事的收音机分心。SAVAA 会轻柔地静音收音机(文本输入),让机器人专注于照片。这阻止了机器人仅仅因为句子在故事中“听起来正确”就完成句子,而不是因为它确实在照片中。
为什么这很重要
该论文在三种不同的智能机器人(LLaVA、Qwen 和 InternVL)上进行了测试,使用了各种要求机器人描述图像的测试。
- 结果:与旧的“固定音量”方法相比,SAVAA 显著减少了编造细节(幻觉)的数量。
- 效率:这一切都是在无需重新训练机器人或使其运行变慢的情况下完成的。它只是在机器人思考时微调注意力旋钮。
总结
将旧方法想象成一位司机,无论他们是在笔直的高速公路上行驶,还是在蜿蜒的山路上行驶,都始终将油门踩在 50% 的位置。他们可能会撞车(产生幻觉),因为他们没有在转弯时减速,或者没有在爬坡时加速。
SAVAA 则是那位不断检查道路、速度和状况的司机,为每一个转弯完美地调整油门和刹车。它确保机器人准确描述它所看到的内容,不多也不少。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。