Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time
本文提出了 LIME,一种无需训练的推理阶段框架,该框架利用层间相关性传播动态调整键值表示,并强化对感知输入而非文本先验的依赖,从而减轻多模态大语言模型中的幻觉问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、多才多艺的机器人助手。这个机器人能够同时看见图片、听见声音并阅读文字。它本应是一名侦探,通过查看照片或聆听录音,准确告诉你正在发生什么。
然而,这个机器人有一个坏习惯:它会对自己撒谎。
有时,你给它看一张空荡荡的公园照片,它却自信地说:“我看见一只狗在玩接球游戏!”或者你播放一段静音录音,它却坚持说:“我听见一只猫在叫!”这被称为幻觉。机器人太习惯于阅读故事和谈论事物,以至于它开始基于“通常”会发生什么进行猜测,而不是观察“实际”存在什么。
问题所在:机器人“文本过重”
这篇论文的作者发现了机器人这样做的原因。他们发现,当机器人做出决定时,它过度依赖其“文本大脑”(即对词汇和故事的知识),而几乎忽略了它的“眼睛”或“耳朵”(即实际的图像或声音)。
这就好比一个学生在参加考试。这名学生刻苦学习,对教科书倒背如流。但当老师展示一张图片并问:“这张图片里有什么?”时,学生却无视图片,直接写下脑海中从教科书里蹦出的第一个念头。这名学生之所以在“幻觉”,是因为他没有观察证据。
解决方案:LIME(推理时模态增强学习)
研究人员创造了一种名为LIME的修复方案。最酷的地方在于?他们无需重新教导机器人或改变其大脑(即代码)。相反,他们在机器人回答问题的瞬间给予它一个“推动”。
以下是 LIME 的工作原理,使用一个简单的类比:
“聚光灯”类比
想象机器人身处一间黑暗的房间里,手持手电筒。
- 没有 LIME 时:机器人将手电筒的光主要照在一堆书本上(即文本)。它忽略了房间里实际的物体(即图像或声音)。它根据书本内容猜测房间里有什么。
- 有了 LIME 时:研究人员安装了一个智能传感器,用于检测机器人正在看哪里。如果机器人开始忽略图片,LIME 就会轻轻地将手电筒光束推回图片上。它迫使机器人说:“等等,让我在说话之前再看一次图像。”
技术实现方式(简化版):
机器人一次回答一个词。每当它准备选择下一个词时,LIME 就会介入并询问:
- “图片在多大程度上帮助你决定了这个词?”
- “文本在多大程度上提供了帮助?”
如果图片提供的帮助不足,LIME 会对机器人的内部记忆(具体是其大脑中的“键”和“值”部分)进行微小且临时的调整,以提高图片的权重。它在瞬间完成这一操作,然后为下一个词重置。这就像教练在球员挥棒前轻声低语:“看球!”
尝试后的结果如何?
研究人员在多种不同任务上测试了该方法:
- 视觉:他们向机器人展示图片,并提问:“有运动球吗?”或“描述这张图片。”
- 音频:他们播放声音,并提问:“你能听到猫叫吗?”
结果:
- 谎言减少:机器人不再编造不存在的事物。如果没有球,它会说“没有”,而不是猜测“有”。
- 专注度提升:当机器人确实谈论某事物时,它实际上是在关注图片的正确部分或声音的正确时刻。
- 无需重新训练:他们无需花费数月时间重新教导机器人。他们只是改变了机器人在回答时的思考方式。
权衡取舍
这里有一个代价。由于 LIME 必须在机器人说的每一个词之前暂停并进行额外的“聚光灯调整”,因此获得答案的时间会稍长一些。这就像拥有一个非常聪明的助手,但由于他们在每句话之前都要双重检查自己的工作,所以速度稍慢。但对于那些准确性比速度更重要的情况来说,这是一个巨大的胜利。
总结
这篇论文表明,人工智能模型经常撒谎,是因为它们过度依赖对词汇的记忆,而不足够依赖它们实际看到或听到的内容。新方法LIME充当了一位实时教练,迫使人工智能在说话前关注证据(即图像或声音),从而在不需从头重新训练人工智能的情况下,得出更加诚实和准确的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。