← 最新论文
💻 computer science

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

本文介绍了 Flat-Pack Bench,这是一个新颖的基准测试,旨在通过家具组装任务评估大型视觉语言模型的细粒度时空推理能力,结果表明当前最先进的模型在时间顺序、状态定位、部件匹配和追踪方面存在显著困难。

原作者: Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向机器人展示一段某人组装书架的视频,来教它如何组装书架。你可能会想:“当然,一个聪明的 AI 可以观看那段视频,看到各个部件,并告诉我哪颗螺丝应该先拧进去。”

但论文《FLAT-PACK BENCH》指出:差得远呢。

以下是研究人员发现的简单解释。

问题:“组装流水线”测试

当前的 AI 模型(称为大型视觉 - 语言模型或 LVLM)擅长看图并说出“那是一只狗”,或观看短视频并说出“有人在跳”。它们就像那些擅长死记硬背事实、却拙于遵循复杂、分步食谱的学生。

研究人员想测试这些 AI 是否能处理一项现实世界的任务:组装家具。这不仅仅是识别一把椅子,而是要理解:

  1. 时间:哪个部件是在另一个部件之前被安装的?
  2. 空间:此刻被握住的是哪条具体的腿?
  3. 追踪:如果一个部件移动到一个盒子后面并从另一侧出来,AI 是否知道那是同一个部件?
  4. 连接:这两个部件是否真正接触并锁定在一起?

解决方案:一场新的“期末考试”

为了测试这一点,该团队创建了FLAT-PACK BENCH

把这想象成针对 AI 的一项专门测试,使用人们组装宜家风格家具的视频。他们不再仅仅问“正在发生什么?”,而是提出一些棘手的问题,例如:

  • “看看视频中的这条特定腿。它是在横梁之前还是之后被拧进去的?”
  • “这里有一张起始状态的部件图片,还有一张结束状态的图片。第二张图片中的哪个部件与第一张图片中的红色部件相匹配?”
  • “这两个部件此刻是否接触?”

为了确保测试公平,他们不仅使用文本,还使用了视觉提示——即用彩色轮廓和数字高亮显示特定部件的图片,这样 AI 就能确切知道要谈论哪个部件。

结果:AI 迷失了方向

研究人员在智能程度最高的可用 AI 模型(包括 GPT-5 和 Gemini 等巨头)上测试了这一基准。

人类得分:人类得分为94%。对我们来说,观看某人组装桌子并理清步骤顺序是再自然不过的事。
AI 得分:最佳 AI 模型的得分约为38%。这仅仅比随机猜测好一点点。

这就像你给一位天才学生看一段魔术表演的视频,让他们解释步骤,而他们每次都猜错顺序。

为什么 AI 失败了?

研究人员深入探究了 AI 失败的原因,并非因为这些问题对人类来说太难,而是因为 AI 缺乏完成这项任务所需的特定“超能力”:

  1. “它去哪了?”问题(追踪):如果一条椅子腿移动到桌子后面,AI 往往会跟丢它。它会忘记哪条腿是哪条。
  2. “它们接触了吗?”问题(接触):AI 难以判断两个部件是否真正物理接触,还是仅仅彼此靠近。这就像 AI 能看到物体,却无法感知它们之间的连接。
  3. “时间旅行”问题(时序推理):AI 不擅长理解长视频中事件的序列。它可能会看到最终结果并猜测顺序,但无法真正观察过程
  4. “走捷径”的习惯:AI 试图作弊。它查看静态图片,并根据常识进行猜测(例如,“腿通常在底部”),而不是真正观看视频以了解实际发生的情况。当研究人员打乱标签以阻止这种作弊行为时,AI 的得分甚至进一步下降。

“工具箱”实验

研究人员不禁要问:“如果我们不要求 AI 完成整个任务呢?如果我们给它一个工具箱呢?”

他们尝试构建一个“智能体”,利用其他专用工具(例如一个追踪物体的工具和一个检查物体是否接触的工具)来辅助 AI 回答问题。

  • 结果:效果不佳。即使是专用工具,也无法在混乱的现实世界视频中准确追踪家具部件。事实证明,当前计算机视觉工具的整个生态系统都难以应对这种涉及“移动部件”的特定谜题。

核心结论

该论文得出结论:虽然 AI 在识别静态图像和短视频方面变得越来越聪明,但在复杂、杂乱的场景中,它对于时间流动物理交互仍然非常“盲目”。

如果你希望 AI 助手通过观看视频来帮你组装家具、烹饪复杂的菜肴或修理机器,我们尚未达到那个阶段。AI 需要学会如何真正“观看”并“理解”事物如何组合在一起的整个过程,而不仅仅是识别故事中的角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →