← 最新论文
💻 computer science

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

该论文介绍了 ReRef-3D,这是一个包含超过 33,000 条用于 3D 场景重排的语言引导指令的综合基准测试,用于评估模型生成满足空间关系的物理有效放置的能力,并揭示了当前的先进模型在处理复杂的关系推理和物理约束方面仍面临显著困难。

原作者: Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你站在一个房间里,桌子上散落着各种颜色的积木、圆柱体和球体。你的朋友指着一个灰色的球说:“把那个放在黄色积木左边的那个积木旁边。”在人类大脑中,这是一个简单且自动化的任务。我们会瞬间识别出黄色积木,找到它左边的那个物体,然后将灰色球滑到一个感觉合适的、位于第二个物体旁边的位置。我们理解“在……旁边”并不意味着一个单一、精确的坐标,而是一个可以容纳球体停留的、可接受的空间小区域,确保球不会从桌子上掉落或撞到其他物体。这种将模糊的空间语言转化为物理动作的能力,是我们与世界互动的基础部分,然而,这仍然是人工智能面临的最困难的挑战之一。

多年来,研究人员一直致力于教计算机识别三维空间中的物体或回答关于它们的问题,但要让机器根据口头指令实际移动一个物体,则是完全不同的挑战。现有的多数测试要求计算机仅仅是指向一个物体或描述一个已经存在的场景。它们并没有要求机器去改变场景。为了弥补这一差距,科罗拉多大学博尔德分校的研究团队引入了一个名为 ReRef-3D 的新基准测试。这不仅仅是测试计算机是否能理解语言,而是测试它能否根据这些语言在虚拟房间中进行物理重排。研究人员构建了一个庞大的数据集,包含数百个 3D 场景中的近 34,000 条指令。这些指令涵盖了从简单的命令(如“把红色的积木放在这里”)到复杂的逻辑链(如“把灰色球放在青色积木后面的黄色积木左边的积木旁边”)。

这项任务的核心难点在于,指令定义的是一个有效的放置区域,而非一个单一的目标点。如果计算机将球放在比“完美”位置稍微偏左或偏右的地方,只要它满足空间规则且没有发生碰撞,它仍然是完全正确的。为了测试这一点,研究人员并没有简单地测量计算机的猜测与预设答案有多接近,而是将计算机提出的位置放入虚拟场景中,然后重新评估整个房间。他们检查物体是否真的在正确的邻居旁边,是否坐在桌子上,以及是否可见。这个过程确保了计算机不仅仅是在记忆坐标,而是在真正地对其实施行为的物理后果进行推理。

该团队在这一基准测试上测试了三种不同类型的人工智能模型。一种是通用的 3D 视觉语言模型,另一种是通过摄像机视角理解 3D 场景的模型,第三种是专门为放置物体而设计的系统。结果显示出了明显的处理能力等级。最先进的模型 LLaVA-3D 成功在有效位置放置物体的指令比例约为 68%。另外两个模型则表现挣扎,成功率仅分别为 32% 和 22%。即使是最优秀的模型在近三分之一的任务中也失败了,这表明虽然这些系统正在进步,但远未达到完美。

研究的一个关键发现是,理解物体之间的关系对于这些模型来说通常比确保放置在物理上可行更容易。模型经常能正确识别目标物体和正确的总体方向,但却无法考虑到碰撞或桌子边缘。例如,一个模型可能正确理解了球需要放在“旁边”,但将其放置在一个会悬浮在空中或穿透另一个物体的位置。研究人员还发现,指令的具体措辞几乎没有影响。无论命令是以僵硬、模板化的风格呈现,还是以更自然、对话式的方式呈现,模型的表现几乎完全相同。这表明目前的局限性并非源于语言灵活性的缺乏,而是源于一种对可视化和执行空间变化的根本性困难。

研究还强调了哪些类型的指令是最难的。涉及“最近”或“在……之间”关系的命令被证明是对所有模型都最具挑战性的。将一个物体放在两个物体“之间”需要系统同时理解相对于两个不同锚点的空间,这一任务甚至让最强的模型也感到困惑。同样,“最近”类的指令要求物体比房间里的任何其他物体都更接近目标,如果模型误判了与第三个未提及物体的距离,这一条件就很容易被违反。相比之下,要求物体处于“最远”位置的指令更容易解决,这可能是因为此类放置的有效区域更大,也更宽容。

最终,ReRef-3D 基准测试表明,尽管人工智能在理解 3D 空间方面取得了进展,但从识别场景到重排场景的跨越仍然巨大。最好的模型可以处理大约三分之二的这类空间谜题,但它们在面对物理现实时仍然会跌倒。研究人员得出结论:将语言落实到物理行动的能力,并不是仅仅能够识别物体或回答问题就能直接获得的。它需要一种更复杂、更独立的推理形式,而目前的系统才刚刚开始掌握这种能力。随着这些模型的不断进化,研究重心正在从仅仅“观察”世界转向“理解如何在这个世界中移动”,这是创造出能在物理环境中真正协助人类的机器人的必要步骤。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →