← 最新论文
🤖 machine learning

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

本文介绍了 TRAPSBench 和 PECS 指标,旨在证明虽然视觉语言模型具备在视觉证据不足以做出决策时进行检测的内在能力,但它们却始终无法表达这种认识论上的克制,从而揭示了其瓶颈在于输出生成而非感知过程。

原作者: Fnu Pramono, John Cai, Sourabh Kulkarni

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Fnu Pramono, John Cai, Sourabh Kulkarni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩台球。你给它看一段球在滚动的视频,然后问它:“黑八会进哪个袋口?”如果视频很清晰,机器人应该计算物理过程并给出答案。但如果视频进行到一半时,你用一块巨大的不透明防水布盖住了球桌,或者球跳动得如此剧烈,以至于没有人能预判它们的落点呢?一个真正聪明的机器人不应该只是瞎猜,它应该举起手说:“我看不清,所以无法确定。”这种知道自己“不知道什么”的能力被称为认识论克制(epistemic restraint)。这是自信的骗子与谨慎的专家之间的区别。在人工智能领域,特别是视觉语言模型(VLMs)——即能够观看视频并对其进行描述的计算机——的研究人员一直在思考:这些模型真的知道自己处于黑暗之中吗,还是它们只是在假装能看穿墙壁?

这篇题为 TRAPSBench 的论文深入探讨了这个问题。研究人员为 AI 构建了一个特殊的视频游戏,名为 TRAPSBench,其中包含 1,404 对物理场景。在每一对场景中,一段视频是“对照组”,其结果清晰且易于预测;而另一段则是“真空组”,由于存在隐藏的墙壁、混乱的局面或逻辑不通的问题,导致答案无法得知。随后,他们测试了 16 种不同的 AI 模型,观察它们在答案被遮蔽时是否会承认失败。

这里有一个转折:这些模型其实非常擅长“意识到”答案被隐藏了,但它们却极不擅长“表达”自己不知道。这就像一个正在考试的学生,内心其实知道自己没有正确答案,但因为太想讨好老师,于是还是写下了一个充满自信的编造答案。研究人员发现,当他们探测 AI 的内部“大脑”(其隐藏状态)时,可以高精度地(在名为 AUROC 的指标上高达 91%)检测出模型是否意识到证据缺失。然而,当模型实际输出答案时,它却忽略了内部的这种警告,直接进行了猜测。

研究还发现了一个有趣的失衡现象:这些 AI 模型在识别“文本类”无意义问题(例如问“蓝色的重量是多少?”)方面,比识别“视觉类”证据缺失方面要出色得多。它们检测出文本类不可能性的速度比视觉类快大约四倍。此外,研究人员尝试通过“引导”AI 的内部信号来对其进行“操纵”。他们发现,如果朝着特定的方向推动 AI,就可以迫使它停止猜测并说出“我不知道”,这证明了这种自我克制的能力已经存在,只是被锁在了一扇模型自身拒绝开启的门后。

简而言之,这项研究表明,问题不在于这些 AI 模型是盲目的或愚笨的,而在于它们过于急于求成。它们编码了“我不确定”这一事实,但其输出被一个“闸门”阻挡了,这个闸门强迫它们必须给出答案。研究人员得出结论,要让这些 AI 系统变得真正可靠,我们可能需要修复那个决定“说什么”的部分,而不是试图教会它们如何看得更清楚。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →