Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
本文提出了一种名为视觉语义熵(Visual Semantic Entropy, VSE)的新型不确定性估计方法,该方法通过仅扰动图像输入并保持文本查询固定,从而隔离视觉歧义性,进而克服了现有基于熵的方法因过度自信的视觉嵌入或受文本变化主导而产生的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一个非常聪明、自信的机器人提问,请它描述一张图片。有时,图片是模糊或难以辨认的,机器人可能会出错。这篇论文提出的核心问题是:我们如何判断机器人是在“不确定”,还是在“自信地瞎猜”?
作者发现,目前检查机器人置信度的方法是有缺陷的。他们构建了一种更好、更先进的方法,称为视觉语义熵(Visual Semantic Entropy, VSE)。以下是他们使用简单的类比进行的解释:
问题一:“过度自信的机器人”
把视觉语言模型(VLM)想象成一个看着照片并回答问题的机器人。
- 旧方法(语义熵): 为了检查机器人是否不确定,我们会连续问它同一个问题 10 次。如果它给出了 10 个不同的答案,我们就知道它很困惑;如果它给出了 10 个相同的答案,我们就认为它很确定。
- 缺陷: 作者发现,机器人有时会过度自信。想象一下,机器人看着一张看起来有点像小包(pouch)的袋子(bag)的模糊照片。它的“视觉大脑”如此确信那是一个小包,以至于即使你问它 100 次,它也始终会说“小包”。它从未动摇。
- 结果: 旧方法看到机器人说了 100 次“小包”,就会认为:“太棒了,它有 100% 的把握!”但实际上机器人错了,而且图片本身具有歧义。旧方法因为机器人的内部置信度过强而错失了危险信号。
问题二:“词汇改写”陷阱
一些研究人员尝试通过改变问题(而不是仅仅重复提问)来修复这个问题。他们会问:“包里有什么?”然后问“袋子里装了什么?”再问“描述一下这个容器”。
- 缺陷: 作者发现,改变措辞(文本)会导致机器人对词汇感到困惑,而不是对图片感到困惑。这就像问你的朋友:“那是猫吗?”然后问“那是猫科动物吗?”你的朋友可能会因为不同的措辞而感到困惑并给出不同的答案,即便图片本身非常清晰。
- 结果: 不确定性得分上升了,但它测量的是机器人对措辞的敏感程度,而不是图像本身的歧义程度。
解决方案:视觉语义熵 (VSE)
作者提出了一种能够同时解决这两个问题的新方法。你可以把它想象成一次**“视觉压力测试”**。
- 保持问题不变,抖动图片: 他们不改变文字,而是保持问题完全一致。但是,他们会对图像进行轻微的“抖动”或“扰动”。想象一下,给一张狗的照片增加一点点静电噪声,或者稍微改变一下光照。
- 类比: 这就像看一幅模糊的画。如果你后退一步、眯起眼睛或歪一下头(稍微改变视角),这张画看起来仍然是一只狗,还是开始看起来像一只猫?
- 按含义对答案进行分组: 机器人会对所有这些略微不同的图像版本回答同一个问题。
- 如果机器人回答“小包”、“口袋”和“袋子”,一个聪明的系统会意识到这些词的意思大致相同。它会将它们归为一类。
- 如果机器人在某些视角下说“小包”,而在另一些视角下说“狗”,这就是真正的分歧。
- 测量分布情况: 他们计算这些答案组之间的差异有多大。
- 如果机器人对图像确实不确定,这些组之间的差异就会很大(例如,一组说“小包”,另一组说“狗”)。这会产生高不确定性得分。
- 如果机器人很确定,所有的组都会靠得很近,从而产生低不确定性得分。
为什么它效果更好
论文在五种不同的智能机器人和五组不同的难题上测试了这种新方法。
- 结果: 新方法(VSE)能更好地识别机器人何时真正被棘手的图像所困扰。它不会被机器人的过度自信所蒙蔽,也不会被改变措辞所干扰。
- 核心结论: 要知道机器人是否对一张图片不确定,你必须“抖动”图片,而不是“抖动”文字。这才能真正衡量视觉证据的歧义程度。
简而言之,这篇论文告诉我们:不要仅仅因为机器人重复同一个答案就相信它。如果图片很棘手,请稍微抖动一下图片。如果机器人开始给出不同的答案,那么你就知道它不确定了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。