← 最新论文
💻 computer science

CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations

该论文引入了 CALIPER,这是一个基于校准的基准测试,旨在证明标准的“干净场景”评估无法区分预训练视觉编码器究竟是真正推断出了质量和摩擦力等物理属性,还是其表现出的能力仅仅依赖于直接的像素级线索而非真正的物理推理。

原作者: Aman Mehta, Riya Baviskar

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Aman Mehta, Riya Baviskar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

为了制造能够穿梭于现实世界的机器,科学家们正在教会计算机不仅要观察形状和颜色,还要理解支配物体运动的隐藏规则。当机器人推动一个箱子时,箱子滑动的距离取决于诸如箱子有多重以及箱子与地面之间存在多少摩擦力等不可见的因素。计算机无法在单张照片中直接看到这些属性;一个轻箱子和一个重箱子在被移动之前,看起来完全一样。为了弥补这一差距,研究人员使用在海量视频库上训练的人工智能模型来充当这些机器人的“眼睛”。这些模型旨在学习物理世界,从而能够预测接下来会发生什么。但多年来,用于评估这些模型的测试过于简单,以至于无法分辨它们是真的在学习物理学,还是仅仅在死记硬背摄像机的视角。

一支独立研究团队最近进行了一项新实验,以观察这些数字之眼是否真的理解物理世界。他们设置了一个模拟场景:一个标准的圆盘撞击一个重量和摩擦力未知的箱子。首先,计算机观看两次练习性的撞击,其中圆盘以已知速度撞击箱子,箱子滑动了特定的距离。这些是校准时刻,让计算机有机会学习箱子的“秘密”。随后,计算机看到第三次撞击,其速度发生了变化,但在圆盘接触箱子的瞬间,视频切断了。计算机现在必须仅根据前两次撞击所学到的知识,预测箱子会滑动多远。研究人员测试了八种不同类型的视觉系统,其范围从经过数百万个视频训练的高度先进模型,到权重完全随机、未经训练的计算机视觉系统。

结果揭示了我们目前评判这些机器人的一个惊人缺陷。当研究人员在完美洁净、静态且相机固定的房间中运行测试时,几乎所有的系统表现都近乎完美,甚至包括那个带有随机权重的系统。计算机并不需要理解物理学就能得到正确答案;它只是学会了在固定的相机视角下,物体的移动会产生特定的像素模式。因为相机从未移动过,计算机可以直接通过屏幕坐标测量滑动距离,而无需知道箱子的质量或摩擦力。这就像一个学生背下了特定考试的答案解析,但如果题目中的数字发生变化,他就无法解题。研究人员发现,在这样洁净的环境中,测试无法区分一个聪明的模型和一个愚笨的模型。

为了解决这个问题,研究人员为每一个视频片段改变了环境。他们随机改变了相机角度、光照、地板颜色,并添加了干扰物体。突然间,像素模式不再能泄露答案。计算机无法再依赖观察屏幕坐标。在这个混乱、不可预测的世界里,结果出现了剧烈的分化。那些旨在预测视频的高度先进模型仍然表现出色,能够高精度地预测滑动距离。然而,那些依赖于观察单帧图像或完全没有经过训练的模型则彻底失败了。那个在洁净房间中得分近乎完美的未经训练的系统,现在的表现并不比一个完全忽略物体、仅根据推力速度进行猜测的系统好多少。

该研究还检查了其他科学家通常如何测试这些模型。一种常见的方法是改变场景中的一个属性,例如让物体稍微变重一点,然后观察计算机的内部表示是否发生了变化。研究人员发现,在许多现有测试中,这种变化微乎其微,以至于计算机的反应仅仅是随机噪声,这意味着测试本身并没有测量到任何真实的东西。他们还观察了“探测器”(probes),即试图直接从计算机大脑中读取特定属性(如质量)的简单测试。他们发现,一个模型可以通过探测测试并表现出似乎知道质量,却在实际做出预测时无法使用该知识。相反,一个模型可能在探测测试中失败,但如果场景提供了其他线索,它仍能有效地利用信息。这证明了仅仅能够从模型的记忆中读取一个属性,并不意味着模型实际上正在利用该属性来理解世界。

最后的衡量标准是一项实际任务:要求计算机选择精确的速度,以便将箱子推向特定的目标距离。在混乱多变的场景中,表现最好的模型偏离目标仅 4.0 毫米。然而,未经训练的模型偏离了 19.6 毫米,其失败率与完全忽略物体进行猜测的失败率一致。研究人员得出结论:一个测试能否区分好模型与坏模型的能力,必须经过证明,而不能仅凭假设。如果一个测试无法区分复杂的 AI 和随机猜测者,那么这个测试本身就是失效的。通过引入现实世界的混沌,并要求计算机利用多次交互中的证据,这种新方法成功揭示了哪些模型真正理解运动物理学,而哪些仅仅是在观察像素。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →