ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
ReVSI 是一项新提出的基准和评估协议,它通过重新标注 381 个场景并再生问答对,确保问题在真实且稀疏采样的视频输入下具有可回答性和准确性,从而解决当前视觉语言模型三维推理评估的系统性无效问题,进而揭示空间智能中此前被掩盖的失败模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在测试一名学生导航房屋并清点内部家具的能力。你给他们一段房屋视频,然后问道:“沙发上有多少个枕头?”
在人工智能领域,研究人员一直使用一种名为VSI-Bench的标准测试来评估人工智能模型(特别是视觉 - 语言模型,或称"VLM")对三维空间的理解程度。但根据这篇论文,该测试存在缺陷。这就像是用一张数字模糊、问题缺失关键细节且答案密钥错误的试卷,来评定学生的数学能力。
作者们引入了一项名为ReVSI的全新重建测试来解决这些问题。以下是他们发现的问题及采取的措施的简要说明,并辅以简单的类比。
1. 问题:“破损的地图”与“眼罩”
该论文指出了旧测试(VSI-Bench)给出误导性评分的两个主要原因:
“破损的地图”(标注漂移):
旧测试依赖于多年前为不同目的创建的“地图”(3D 数据)。这就像是用 1990 年绘制的一张潦草的手绘地图来导航今天的城市。- 缺失物体: 旧地图可能显示没有椅子,因为扫描仪漏掉了它,但在实际视频中,椅子清晰可见。AI 因为看到了椅子而受到惩罚,尽管“答案密钥”说它不应该存在。
- 错误标签: 地图可能将“杯子”标记为“笔记本”,因为 3D 形状发生了扭曲。AI 感到困惑,因为视频清楚地显示那是一个杯子。
- 糟糕的几何结构: 地图可能因为扫描仪被镜子迷惑而将房间面积计算为 20 平方米,但视频显示实际面积为 40 平方米。
“眼罩”(帧采样):
现代人工智能模型通常不会观看整个视频;为了节省时间,它们只查看少量快照(帧)。- 想象一下,你问某人:“这个房间里有多少人?”但你只给他们看了一张房间空无一人的照片。
- 旧测试假设 AI 能够看到整个视频。但事实上,如果 AI 只看到了 1000 帧中的 16 帧,它可能会完全错过该物体。旧测试没有考虑到这一点,因此提出了基于 AI 实际拥有的有限视角根本无法回答的问题。
2. 解决方案:ReVSI(“翻新的房屋”)
作者们并没有仅仅微调旧测试,而是将其彻底推翻并从头重建。他们称之为ReVSI。
- 重新标注房屋: 他们聘请人类专家查看原始视频,并手动绘制新的、完美的“地图”。他们修复了缺失的椅子,纠正了错误的标签,并根据视频中实际存在的内容(而非嘈杂扫描仪认为存在的内容)准确测量了房间。
- “帧感知”规则: 他们改变了游戏规则。现在,如果 AI 只被允许查看 16 帧,那么测试问题就是专门针对这 16 帧生成的。如果物体不在这些帧中,问题就会更改或被移除。这确保了 AI 仅就其实际能看到的内容接受测试。
- “假视频”压力测试: 这是他们最具创意的工具。他们制作了“假视频”,在数字上擦除了 AI 本应找到的物体。
- 测试: 他们向 AI 展示一段客厅视频,但移除了所有包含“枕头”的帧。
- 目标: 一个聪明的 AI 应该说:“我看不到任何枕头,所以答案是零。”
- 结果: 许多 AI 模型没有回答“零”,而是猜了"2"或"3",因为它们记住了客厅通常都有枕头。这揭示出这些模型是在幻觉(基于记忆猜测),而不是在观察(查看证据)。
3. 令人震惊的结果
当他们运行新测试时,AI 模型的排名发生了巨大变化:
- “专有”模型(大型科技公司): 像 GPT-5.2 和 Gemini 3 这样的模型实际上表现得相当好。它们似乎更依赖于它们在视频中实际看到的内容,而不是猜测。
- “开源”模型: 许多在旧测试中表现出色的模型突然显得糟糕得多。它们的分数大幅下降,因为它们依赖于旧测试的“破损地图”和“偏见”。
- “专用”模型: 一些专门训练用于擅长 3D 任务的模型,在新测试中的表现甚至比其未训练版本更差。这表明它们过度拟合了旧测试中的错误数据,学会了“错误的答案”而非正确的推理。
结论
该论文认为,我们不能信任当前 AI 空间智能的分数,因为测试存在缺陷。ReVSI是一项新的、更严格、更诚实的考试。它迫使 AI 证明它确实在查看提供的视频帧,而不是仅仅根据它认为房间应该是什么样子来猜测。
简而言之:旧测试就像是一位老师根据一张模糊的照片和错误的答案密钥来给学生打分。而 ReVSI 则是一位老师,递给学生的是一段清晰的高清视频,并提出的问题与该视频中可见的内容完全匹配。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。