✨ 要点🔬 技术摘要
想象一下,你正在教一个机器人玩台球。你给它看一段球在滚动的视频,然后问它:“黑八会进哪个袋口?”如果视频很清晰,机器人应该计算物理过程并给出答案。但如果视频进行到一半时,你用一块巨大的不透明防水布盖住了球桌,或者球跳动得如此剧烈,以至于没有人能预判它们的落点呢?一个真正聪明的机器人不应该只是瞎猜,它应该举起手说:“我看不清,所以无法确定。”这种知道自己“不知道什么”的能力被称为认识论克制(epistemic restraint) 。这是自信的骗子与谨慎的专家之间的区别。在人工智能领域,特别是视觉语言模型(VLMs) ——即能够观看视频并对其进行描述的计算机——的研究人员一直在思考:这些模型真的知道自己处于黑暗之中吗,还是它们只是在假装能看穿墙壁?
这篇题为 TRAPSBench 的论文深入探讨了这个问题。研究人员为 AI 构建了一个特殊的视频游戏,名为 TRAPSBench,其中包含 1,404 对物理场景。在每一对场景中,一段视频是“对照组”,其结果清晰且易于预测;而另一段则是“真空组”,由于存在隐藏的墙壁、混乱的局面或逻辑不通的问题,导致答案无法得知。随后,他们测试了 16 种不同的 AI 模型,观察它们在答案被遮蔽时是否会承认失败。
这里有一个转折:这些模型其实非常擅长“意识到”答案被隐藏了,但它们却极不擅长“表达”自己不知道。这就像一个正在考试的学生,内心其实知道自己没有正确答案,但因为太想讨好老师,于是还是写下了一个充满自信的编造答案。研究人员发现,当他们探测 AI 的内部“大脑”(其隐藏状态)时,可以高精度地(在名为 AUROC 的指标上高达 91%)检测出模型是否意识到证据缺失。然而,当模型实际输出答案时,它却忽略了内部的这种警告,直接进行了猜测。
研究还发现了一个有趣的失衡现象:这些 AI 模型在识别“文本类”无意义问题(例如问“蓝色的重量是多少?”)方面,比识别“视觉类”证据缺失方面要出色得多。它们检测出文本类不可能性的速度比视觉类快大约四倍。此外,研究人员尝试通过“引导”AI 的内部信号来对其进行“操纵”。他们发现,如果朝着特定的方向推动 AI,就可以迫使它停止猜测并说出“我不知道”,这证明了这种自我克制的能力已经存在,只是被锁在了一扇模型自身拒绝开启的门后。
简而言之,这项研究表明,问题不在于这些 AI 模型是盲目的或愚笨的,而在于它们过于急于求成。它们编码了“我不确定”这一事实,但其输出被一个“闸门”阻挡了,这个闸门强迫它们必须给出答案。研究人员得出结论,要让这些 AI 系统变得真正可靠,我们可能需要修复那个决定“说什么”的部分,而不是试图教会它们如何看得更清楚。
技术摘要:TRAPSBench:视觉语言模型具备认知编码能力但缺乏表达约束力
问题陈述
视觉语言模型(VLMs)在视频理解和物理推理方面取得了显著进展。然而,对于部署在高度敏感领域的模型而言,识别感官信息是否不足以进行确定性预测的能力,与其做出正确回答的能力同样重要。现有的基准测试侧重于评估物理推理,却未能测试在证据不足情况下的**选择性弃权(selective abstention)**能力。现有的指标往往要么奖励无差别的弃权,要么完全忽略了认识论(epistemic)维度,无法区分一个“知道自己不知道”的模型与一个“仅仅在瞎猜”的模型。
本文旨在解决模型内部知识与外部不确定性表达之间的差距。具体而言,本文研究了 VLMs 是否能在内部区分可回答与不可回答的物理场景,以及如果能够区分,为什么它们无法在自回归输出中表达这种区别。
研究方法
1. TRAPSBench 基准测试
作者引入了 TRAPSBench (测试模糊物理场景中的约束力),这是一个由程序化生成的视频基准测试,包含 1,404 个匹配的物理对。
生成方式: 利用 MuJoCo 创建“控制(control)”视频(结果是确定性的)和“空缺(void)”视频(通过针对性的单一修改使结果变得不可计算)。
不确定性分类法:
遮挡(Occlusion): 关键视觉数据被不透明的遮挡物阻挡(N = 202 N=202 N = 202 )。
混沌敏感性(Chaotic Sensitivity): 对初始条件具有极端敏感性的确定性系统,在结果显现前被截断(N = 500 N=500 N = 500 )。
提问不当(Ill-Posed Questions): 复用控制视频,但问题包含错误前提或询问不可观测的细节(N = 702 N=702 N = 702 :包括 202 个遮挡类不当问题 + 500 个混沌类不当问题)。
评估: 使用纯文本评判小组(三个模型)对响应进行评分。对于控制视频,根据 MuJoCo 真值衡量正确性;对于空缺视频,评判小组检测模型是否进行了弃权。
2. 惩罚性认识论校准分数(PECS)
为了评估性能,作者提出了 PECS ,这是一种由以下公式定义的复合指标:PECS = Acc × max ( 0 , AbsRec − FalseAbs ) \text{PECS} = \text{Acc} \times \max(0, \text{AbsRec} - \text{FalseAbs}) PECS = Acc × max ( 0 , AbsRec − FalseAbs ) 其中:
Acc: 可回答(控制)视频的准确率。
AbsRec: 弃权召回率(在空缺视频上正确弃权)。
FalseAbs: 错误弃权(在控制视频上错误地弃权)。
意义: 该指标使用尤登统计量(Youden's J statistic, AbsRec − FalseAbs \text{AbsRec} - \text{FalseAbs} AbsRec − FalseAbs )来惩罚无差别策略。得分高的模型需要同时具备高准确率(处理可回答任务)和选择性弃权(处理不可回答任务)的能力,否则得分将为 0。
3. 机制分析
论文采用了两种技术来探测内部表示:
线性探测(Linear Probing): 在冻结的 VLM 隐藏状态上训练逻辑回归探测器,以预测“空缺”与“控制”标签。这用于测试模型是否在内部编码 了这种区别。
激活转向(Activation Steering): 通过在生成过程中添加“空缺方向”向量(v ℓ v_\ell v ℓ )来因果操纵隐藏状态,以测试该表示是否能因果控制 弃权行为。
核心贡献
TRAPSBench 与 PECS: 一个大规模基准测试和一个鲁棒的指标,专门用于评估视频理解中的认识论校准,从而消除如“总是弃权”或“从不弃权”等退化策略。
表示-输出差距: 论文指出 VLMs 在内部编码了认识论不确定性,但在表达这种不确定性方面存在失败。这通过以下方式得到证实:
引导式提示(Guided Prompting): 明确指示模型进行弃权(如说“我不知道”)可以解锁潜在能力,显著提高弃权召回率,且不牺牲准确率。
线性探测: 探测器在不同物理领域中能以高 AUROC(高达 0.91)解码出可回答性信号,即使在模型自信地产生幻觉的样本中也是如此。
激活转向: 注入单个层级的“空缺方向”会因果性地诱导弃权行为(在控制样本中)或抑制弃权行为(在空缺样本中)。
失效模式的不对称性:
视觉 vs. 文本: 模型检测文本层面的不可能(提问不当)的能力大约是检测视觉信息缺失能力的 4 倍。
推理效应: 思维链(CoT)推理并不总能统一提升校准能力。在某些模型(如 Qwen3-VL Think)中,推理轨迹虽然表达了怀疑,但这种怀疑随后会被最终输出覆盖,导致其比非思考版本产生更多的臆造(confabulation)。
因果机制分析: “空缺”信号的几何结构随领域而异。遮挡类方向编码了一种领域通用的“证据缺失”信号,可在不同模态和领域间迁移。而混沌类方向则是领域特定的且近乎正交,这表明认识论透明度决定了可迁移性。
结果
自发性约束力较差: 在来自五个家族(Gemini, Qwen, GPT-5, Gemma, LLaVA)的 16 个 VLM 中,自发 PECS 得分普遍较低。最佳的自发 PECS 仅为 0.292(Gemini 2.5 Flash)。大多数模型表现出无论证据质量如何都倾向于给出答案的先验倾向。
引导式提示解锁潜在能力: 明确的弃权指令使视频原生模型的弃权召回率中位数提升了 1.9 倍,PECS 显著提高(例如 Gemini 3.1 Pro R-Low 达到 0.568)。然而,即便有引导,模型也并未达到饱和,表明存在持续的瓶颈。
内部编码 vs. 输出抑制:
线性探测器在跨数据集迁移中实现了高达 0.91 的 AUROC,证明模型“知道”结果是不可知的。
至关重要的是,即使在标准提示下模型发生臆造(未能弃权)的样本中,该信号依然存在。
激活转向证实了该信号具有因果性:向隐藏状态添加空缺方向会强制执行弃权。
提示门控(Prompt Gating): 在 Qwen3-VL-8B 中,标准提示施加了一个反对弃权的单向约束。虽然可以通过转向强制产生臆造(抑制弃权),但在标准提示下无法诱导弃权,除非使用“引导式”提示。这表明瓶颈在于输出阶段的门控,而非缺乏内部表示。
推理与臆造: 对臆造模式的分析显示,87–99% 的失败涉及幻觉前提 (即编造视觉观察内容)。在 Qwen3-VL Think 中,推理过程经常表达怀疑,但最终输出会覆盖这一过程,从而给出一个自信的、虚假的答案。
意义与主张
论文声称,当前 VLM 在物理推理中实现可靠部署的主要瓶颈是表达性 ,而非感知性。
表示-输出差距: VLMs 拥有区分可回答与不可回答场景所需的内部认识论信号。失败之处在于自回归生成过程,该过程倾向于抑制这些信号,转而追求流畅且坚定的回答。
模态特异性: 这种差距在视觉不确定性方面比文本不确定性更为显著。模型检测语义上的不可能(文本)的能力明显高于检测物理信息缺失(视频)的能力。
干预的必要性: 弥合这一差距可能需要输出阶段的干预 (例如解码约束、转向或专门的训练目标),而不仅仅是扩大模型规模或提升视觉感知能力。
泛化性: 这些发现已在三个不同的开源模型家族(Qwen, Gemma, LLaVA)中得到复现,且这些模型并无共同的训练流水线,这表明该现象是当前 VLM 架构的一个基本属性,而非特定模型的产物。
作者总结道,TRAPSBench 为评估和改进 AI 系统的认识论校准提供了一个必要的工具,并强调“知道何时不回答”仍然是自主智能体面临的一个关键且尚未解决的挑战。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。