← 最新论文
💬 NLP

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

本文介绍了 ReVisiT,这是一种无需训练的解码方法,它通过将视觉令牌中的相关视觉语义动态地投射到文本生成过程中,从而减轻大型视觉语言模型中的幻觉问题,并以降低的计算成本实现了更优越的性能。

原作者: Beomsik Cho, Jaehyung Kim

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Beomsik Cho, Jaehyung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《ReVisiT:揭示视觉令牌中的视觉语义以指导大型视觉语言模型解码》的通俗解释,辅以富有创意的类比。

核心问题:“白日梦”艺术家

想象你聘请了一位才华横溢的艺术家(即大型视觉语言模型,LVLM)来描述你展示给他们的照片。你给他们看了一张桌子上放着红苹果的照片。

理想情况下,艺术家看着照片会说:“那是一个红苹果。”
但有时,艺术家会被自己内心的想法分散注意力。他们可能会说:“那是一个红苹果……而且还有一个香蕉和一个披萨",尽管这些东西根本不在照片里。这被称为幻觉

这篇论文提出了一个问题:为什么会发生这种情况?
研究人员发现,这位艺术家实际上在他们的“心眼”(即视觉数据)中正确地看到了苹果,但当他们开始说话时,却被自身词汇的噪音所迷惑。他们知道真相,却忘记说出来,因为他们过于关注哪些词通常搭配在一起(例如“苹果”和“派”),而不是照片中实际有什么。

发现:“隐藏笔记”

研究团队仔细研究了这些人工智能模型的工作原理。他们发现,模型将图像分解为称为视觉令牌(vision tokens)的微小片段。你可以将这些令牌想象成贴在图像不同部分的小便签。

  1. 便签很聪明:即使人工智能犯错(幻觉出一个香蕉),图像上的便签仍然包含关于苹果的正确信息。视觉真相就在那里,只是被埋没了。
  2. 翻译问题:当人工智能试图将这些便签转化为文字时,情况会变得混乱。如果你问人工智能:“这张便签代表什么词?”而没有给出任何规则,它可能会猜“天空”、“蓝色”或“纹理”。这太模糊了。
  3. 魔法过滤器:研究人员发现,如果给问题加上一个过滤器——要求人工智能从特定的相关词列表中选择(例如“苹果”、“水果”、“红色”)——这些便签突然变得非常清晰。人工智能终于可以说:“啊!这张便签肯定意味着‘苹果’!”

解决方案:ReVisiT(引用视觉令牌)

基于此,作者创建了一种名为ReVisiT的新方法。这就像在艺术家说话时给他们一张“小抄”,但不需要重新训练这位艺术家,也不需要聘请新的艺术家。

以下是 ReVisiT 的工作原理,分步说明:

  1. 上下文检查:当人工智能开始写句子时,ReVisiT 会查看人工智能当前正在思考的内容。
  2. 过滤器:它根据该上下文创建一个小的相关词列表(例如,如果句子是关于厨房的,列表包括“杯子”、“勺子”、“苹果”,但不包括“飞机”)。
  3. 匹配:ReVisiT 查看图像中的所有“便签”(视觉令牌),并问道:“这些便签中哪一个与我们当前的词列表最匹配?” 它会选出最佳的一个匹配项。
  4. 推动:它拿走那张获胜的便签,轻轻地将人工智能的下一个词选择推向它。这就像在耳边低语:“嘿,记得那张便签吗?它说的是‘苹果’,而不是‘香蕉’。”

为什么这很酷

  • 无需训练:你不需要教人工智能任何新东西。你只需要改变它在说话时的表达方式。
  • 超级快速:因为它只是一个快速的数学检查和一次“推动”,所以不会拖慢人工智能的速度。事实上,它几乎和标准的说话方式一样快。
  • 无处不在:他们在许多不同的人工智能模型(从小型到超大型)以及许多不同任务(描述图像、回答问题、识别物体)上进行了测试。它一致地减少了“白日梦”(幻觉),并使描述更加准确。

类比:图书管理员与书本

想象人工智能是一个正在参加考试的学生。

  • 视觉令牌是学生桌上摊开的教科书。学生确实在书中拥有正确的答案。
  • 幻觉发生是因为学生试图忽略书本,仅凭记忆猜测答案,或者书本翻到了错误的页面。
  • ReVisiT就像一位图书管理员走过来,看着问题,指出教科书中恰好包含答案的那一页,并说:“读这部分。”然后学生从书中读出正确答案,而不是去猜测。

总结

这篇论文证明,人工智能模型在其视觉数据内部已经“看到”了真相,但它们往往无法将其说出来,因为它们迷失在自己的词汇联想中。ReVisiT是一个简单、免费的工具,它充当桥梁,迫使模型查看其自身的视觉笔记并利用它们来纠正其言语,从而减少谎言,提高描述的准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →