← 最新论文
💬 NLP

LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

本文介绍了 LookBack,这是一种无需训练的方法,它通过将视觉回溯分数与标记似然度相结合来增强对 LVLM 响应的评分,从而更好地检测幻觉并选择具有落地性的输出,解决了现有基于置信度指标的局限性。

原作者: Beomsik Cho, Jinhyeong Kim, Dongseok Lee, Jaehyung Kim

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Beomsik Cho, Jinhyeong Kim, Dongseok Lee, Jaehyung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在和一个既有眼睛又有大脑的超级聪明的机器人说话。这个机器人被称为“大型视觉语言模型”(简称 LVLM)。它可以观察一张图片,然后针对图片写一个故事或回答一个问题。这就像拥有一个能看清世界并完美描述世界的伙伴。但问题在于:有时这个机器人会对自己的声音过于自信。它可能会用如此完美的语法和流畅度来描述一个场景,听起来完全真实,即便它描述的内容在图片中根本不存在。这被称为“幻觉”。

为了解决这个问题,科学家通常会尝试从机器人给出的许多猜测中挑选出最好的答案。他们经常使用一个简单的技巧:挑选那个根据机器人自身内部数学逻辑听起来最自信或最可能的答案。这就像一位老师挑选那篇读起来最流利的作文。但如果这个机器人只是一个说话圆滑但却在自信地胡说八道的人呢?这就是这篇论文要解决的问题:我们如何判断机器人是真的在看图片,还是在装模作样地白日做梦?

来自延世大学的研究人员发现,机器人的常规“信心计”在面对图片时是失灵的。他们发现,即使你把图片拿走,只让机器人去猜,它仍然会对它的答案给出同样高的置信度分数。这就像一个学生可以完美地背诵一篇历史论文,但如果你问他关于教科书中某张特定照片的情况,他可能会自信地描述教室里有一只恐龙,因为他只是擅长猜测词汇,而不是在观察证据。

为了解决这个问题,团队发明了一种名为 LOOKBACK 的新方法。想象一下你正在重新批改那个学生的作文。与其只检查句子的流畅度,不如问:“你在写这个词的时候,真的看照片了吗?”LOOKBACK 是一个特殊的工具,它会检查机器人写的每一个词,以查看机器人的“眼睛”(其内部注意力)在写下那个词的瞬间是否真的在注视着图片。

它是这样运作的(用一种有趣的方式来解释):

  1. 信心检查:首先,LOOKBACK 会检查机器人对一个词有多确定,就像旧方法那样。
  2. 回看检查:然后,它会问:“你是看了图片才说出这个词的吗?”如果机器人说“熊猫”,而它的内部眼睛正盯着图像中的一只熊猫,那么这个词就会获得巨大的加分。如果机器人说“熊猫”,但它只是因为喜欢“熊猫”这个词而在瞎猜,那么它就会受到惩罚。
  3. 最终得分:该工具结合了这两项检查。它会将最高分给那些不仅表达流利、自信,而且证明了自己确实是在参考视觉证据的答案。

团队在涉及图片和问题的四个不同挑战中测试了这个想法,并使用了三种不同的智能机器人大脑。他们发现 LOOKBACK 在挑选正确答案方面比旧方法表现得好得多。事实上,当团队让机器人生成 25 个不同的猜测,并使用 LOOKBACK 来挑选胜出者时,它比他们尝试过的任何其他方法都能更频繁地选出正确答案。

真正酷的一点是,LOOKBACK 不需要学习任何新知识,也不需要使用任何额外的机器人来帮忙。它只是利用了主机器人思考时已经发出的信号。这就像是给机器人一面镜子,让它在不需要老师监督的情况下也能检查自己的工作。这项研究表明,通过简单地要求机器人说话时“回看”图片,我们可以阻止它自信地编造关于所见之物的谎言,从而让这些 AI 伙伴在现实任务中变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →