Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
本文介绍了 ReVisiT,这是一种无需训练的解码方法,它通过将视觉令牌中的相关视觉语义动态地投射到文本生成过程中,从而减轻大型视觉语言模型中的幻觉问题,并以降低的计算成本实现了更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《ReVisiT:揭示视觉令牌中的视觉语义以指导大型视觉语言模型解码》的通俗解释,辅以富有创意的类比。
核心问题:“白日梦”艺术家
想象你聘请了一位才华横溢的艺术家(即大型视觉语言模型,LVLM)来描述你展示给他们的照片。你给他们看了一张桌子上放着红苹果的照片。
理想情况下,艺术家看着照片会说:“那是一个红苹果。”
但有时,艺术家会被自己内心的想法分散注意力。他们可能会说:“那是一个红苹果……而且还有一个香蕉和一个披萨",尽管这些东西根本不在照片里。这被称为幻觉。
这篇论文提出了一个问题:为什么会发生这种情况?
研究人员发现,这位艺术家实际上在他们的“心眼”(即视觉数据)中正确地看到了苹果,但当他们开始说话时,却被自身词汇的噪音所迷惑。他们知道真相,却忘记说出来,因为他们过于关注哪些词通常搭配在一起(例如“苹果”和“派”),而不是照片中实际有什么。
发现:“隐藏笔记”
研究团队仔细研究了这些人工智能模型的工作原理。他们发现,模型将图像分解为称为视觉令牌(vision tokens)的微小片段。你可以将这些令牌想象成贴在图像不同部分的小便签。
- 便签很聪明:即使人工智能犯错(幻觉出一个香蕉),图像上的便签仍然包含关于苹果的正确信息。视觉真相就在那里,只是被埋没了。
- 翻译问题:当人工智能试图将这些便签转化为文字时,情况会变得混乱。如果你问人工智能:“这张便签代表什么词?”而没有给出任何规则,它可能会猜“天空”、“蓝色”或“纹理”。这太模糊了。
- 魔法过滤器:研究人员发现,如果给问题加上一个过滤器——要求人工智能仅从特定的相关词列表中选择(例如“苹果”、“水果”、“红色”)——这些便签突然变得非常清晰。人工智能终于可以说:“啊!这张便签肯定意味着‘苹果’!”
解决方案:ReVisiT(引用视觉令牌)
基于此,作者创建了一种名为ReVisiT的新方法。这就像在艺术家说话时给他们一张“小抄”,但不需要重新训练这位艺术家,也不需要聘请新的艺术家。
以下是 ReVisiT 的工作原理,分步说明:
- 上下文检查:当人工智能开始写句子时,ReVisiT 会查看人工智能当前正在思考的内容。
- 过滤器:它根据该上下文创建一个小的相关词列表(例如,如果句子是关于厨房的,列表包括“杯子”、“勺子”、“苹果”,但不包括“飞机”)。
- 匹配:ReVisiT 查看图像中的所有“便签”(视觉令牌),并问道:“这些便签中哪一个与我们当前的词列表最匹配?” 它会选出最佳的一个匹配项。
- 推动:它拿走那张获胜的便签,轻轻地将人工智能的下一个词选择推向它。这就像在耳边低语:“嘿,记得那张便签吗?它说的是‘苹果’,而不是‘香蕉’。”
为什么这很酷
- 无需训练:你不需要教人工智能任何新东西。你只需要改变它在说话时的表达方式。
- 超级快速:因为它只是一个快速的数学检查和一次“推动”,所以不会拖慢人工智能的速度。事实上,它几乎和标准的说话方式一样快。
- 无处不在:他们在许多不同的人工智能模型(从小型到超大型)以及许多不同任务(描述图像、回答问题、识别物体)上进行了测试。它一致地减少了“白日梦”(幻觉),并使描述更加准确。
类比:图书管理员与书本
想象人工智能是一个正在参加考试的学生。
- 视觉令牌是学生桌上摊开的教科书。学生确实在书中拥有正确的答案。
- 幻觉发生是因为学生试图忽略书本,仅凭记忆猜测答案,或者书本翻到了错误的页面。
- ReVisiT就像一位图书管理员走过来,看着问题,指出教科书中恰好包含答案的那一页,并说:“读这部分。”然后学生从书中读出正确答案,而不是去猜测。
总结
这篇论文证明,人工智能模型在其视觉数据内部已经“看到”了真相,但它们往往无法将其说出来,因为它们迷失在自己的词汇联想中。ReVisiT是一个简单、免费的工具,它充当桥梁,迫使模型查看其自身的视觉笔记并利用它们来纠正其言语,从而减少谎言,提高描述的准确性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。