← 最新论文
💬 NLP

Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation

这项研究表明,虽然小型视觉-语言模型在现实图像退化条件下拥有关于其错误的准确内部自我认知,但它们无法将这种不确定性转化为语言表达,这使得内部标记概率成为比陈述置信度更优越的推迟决策信号,尽管在严重的低光照条件下,这两种信号都会变得不可靠。

原作者: M M Asif Ferdous

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: M M Asif Ferdous

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一个繁忙的城市里,身边跟着一个非常聪明但个头极小的机器人向导。这个机器人有一双摄像头作为眼睛,还有一个用于说话的声音。它的任务是观察周围的事物并告诉你它们是什么。但问题在于,这个城市很“乱”。有时阳光太刺眼,有时漆黑一片,有时你的相机镜头又模糊或在晃动。在人工智能的世界里,这些“糟糕”的照片被称为退化图像(degraded images)

当像这样的机器人被一张糟糕的照片搞糊涂时,它需要知道什么时候该说:“我不知道,请去问问人类”,而不是自信地猜错答案。这种知道自己何时不确定的能力被称为不确定性(uncertainty)。机器人有两种展示这种不确定性的方式。第一种是言语化置信度(verbalized confidence):机器人直接大声说,“我有90%的把握!”第二种是内部置信度(internal confidence):这是机器人大脑中一个秘密的、无声的信号,用来衡量它的想法有多么摇摆不定,即使它一言不发。大多数人认为,如果机器人说它很有信心,那它可能真的很有信心。但如果机器人只是个蹩脚的骗子呢?这就是这篇论文要探讨的核心问题。


关于“无声信号”的故事

在这项研究中,研究人员让两个小型开源机器人向导(称为 Qwen2-VLSmolVLM)接受了一场严格的测试。他们没有只给它们看清晰、完美的照片。相反,他们拍了100张食物的照片,并故意用六种不同的方式破坏了它们:通过压缩质量(如JPEG文件)、运动模糊、调暗光线直到几乎全黑、增加刺眼的眩光、倾斜相机,或者缩放和拉伸图像。他们针对每种破坏类型都设置了三个不同的严重程度等级。

机器人必须在每一张被破坏的照片中猜出食物是什么。然后,研究人员检查了两件事:

  1. 机器人是说了“我有信心!”还是“我不确定”?(言语化信号
  2. 机器人的秘密内部得分(即它有多大的概率是正确的)是多少?(内部信号

大惊喜:那个拒绝承认错误的机器人

结果就像是在看一个魔术师,他虽然水平很差,却一直在鞠躬并高喊:“刚才那场表演完美无缺!”

言语化信号(机器人的嘴巴):
当被问及置信度时,这些机器人表现得异常固执。无论照片多么糟糕,无论多么模糊或黑暗,它们都坚持说自己有大约 87% 到 90% 的把握。甚至当照片黑到机器人基本上只能随机猜测(正确率仅为 22%)时,它依然自信地宣称:“我有87%的把握!”这就像机器人的置信度旋钮卡在了“高”档位。事实上,对于其中一个机器人来说,要求它给出置信度数值是非常困难的,因为它大多时候只是拒绝回答,只给出食物的名字而没有任何数字。

内部信号(机器人的大脑):
然而,当研究人员窥视机器人的大脑,查看其秘密的“Token概率”(一种衡量机器人自身数学逻辑确定性的高级方式)时,他们发现了完全不同的情况。机器人的内部信号其实非常诚实!当照片清晰时,内部得分很高;当照片模糊或黑暗时,内部得分显著下降。这个秘密信号非常擅长发现错误,它能以 92% 到 99% 的准确率分辨出答案是正确还是错误。

“低光照”陷阱

不过,故事中出现了一个可怕的时刻。当研究人员将照片变得极其黑暗(即“严重曝光不足”等级)时,两种信号都失效了。机器人的准确率崩塌了(从 99% 跌至 22%),甚至连那个诚实的内部信号也停止了工作。它无法再区分正确答案和错误答案,仿佛黑暗如此浓厚,以至于连机器人的秘密大脑也变得一片混沌。

这对你意味着什么

那么,研究人员到底学到了什么呢?

  1. 不要相信机器人的嘴。 如果你问一个小型的机器人向导它有多确定,它很可能会撒谎说它非常有信心,即便它已经完全迷失了。论文表明,这种“陈述的置信度”对于判断何时该停下来寻求人类帮助是毫无用处的。
  2. 信任机器人的大脑(大部分情况下)。 秘密的内部数学逻辑要好得多。它知道自己何时感到困惑,并可以将这一信号传递给计算机系统,从而让系统说:“好吧,我不确定,让我们找个人来检查一下。”
  3. 但要警惕黑暗。 即便是诚实的内部信号,在图像过于黑暗时也会失效。如果你在黑暗的房间或夜间使用这些机器人,你不能依赖机器人来告诉你它是否失败了。你需要一个单独的“安全检查”机制,在机器人尝试观察之前,先确保照片不会太暗。

简而言之,小型AI机器人在其代码深处知道自己错了,但它们就是不会说出来。它们就像是一个学生在考试中答错了题,却仍然举手说:“我对这个答案非常有把握!”捕捉它们的唯一方法是去看它们秘密的“草稿纸”,而不是听它们说什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →