StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos
本文介绍了 StateTrace,这是一个以对象为中心的框架,它为 VideoLLM 提供了一个结构化的时空记忆,使其能够在长视频中的不可见间隔期间显式地推理隐藏的对象状态,从而显著提升了在本文新提出的 HSR-Bench 及现有基准测试上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,机器在观察视频并描述其所见内容方面已经变得非常出色。它们可以识别出一个人正在奔跑、一辆车正在转弯,或者一只狗正在追逐球。然而,这些数字观察者在面对“不可见”的事物时存在一个显著的盲点。如果一个物体从屏幕上消失了——被墙壁挡住、被收进盒子里或被另一个物体覆盖——当前的AI模型往往会完全忘记它的存在。它们将“不可见”视为“未知”,无法推理出该物体仍然存在于那里,且其状态(如位置或颜色)很可能并未改变。这种局限性成为了分析长视频时的一个主要障碍,在这些视频中,物体可能会长时间处于隐藏状态,但观众仍可能需要知道它们在哪里或发生了什么。
为了解决这个问题,研究人员开发了一种名为 StateTrace 的新方法。StateTrace 并不仅仅依赖于当前帧中的可见内容,而是为 AI 提供了一种即使在物体被遮挡时也能记忆并追踪物体的方法。研究人员构建了一个框架,该框架充当视频的持久记忆,不仅记录所见之物,还记录事物消失时发生了什么。它追踪物体被遮挡的时刻、消失的原因以及位置和外观的最后已知细节。通过将这些信息组织成一个结构化的时间线,该系统可以在物体离开屏幕很久之后,仍然能够回答有关其隐藏状态的问题。
研究人员通过创建一套专门设计用来“陷阱”标准 AI 模型的挑战来测试这一想法。他们汇编了一个名为 HSR-Bench 的基准测试,其中包含来自近 1,400 个独特视频的 1,400 多个视频问题。这些问题侧重于物体被遮挡、被包含或被覆盖的情景,要求 AI 在没有直接视觉证据的情况下进行推断。例如,一个问题可能会询问被巴士挡住几秒钟后的汽车颜色,或者在物品在容器之间交换后,哪个杯子里装有钉子。当研究人员将 StateTrace 应用于强大的现有视频模型时,结果令人瞩目。在这个新的基准测试上,模型的准确率大幅提升,有些甚至从大约 40% 的正确率跃升到了 64% 以上。这表明,赋予 AI 一种关于不可见事物的结构化推理能力,是使其像人类一样理解世界的关键一步。
StateTrace 系统的核心是一个在 AI 尝试回答问题之前进行的三个步骤的过程。首先,系统会对整个视频进行离线分析,将其分解为若干片段。它识别物体、追踪它们的运动,并精确记录它们何时以及如何消失。如果一辆汽车被一辆巴士遮挡,系统会记录这一事件,注明巴士是诱因,并记录汽车最后的已知位置。它构建了一张详细的事件图谱,创建了一个“时空状态记忆”,将物体与其可见性和交互的历史联系起来。这个记忆不仅仅是帧的列表;它是一个理解关系的连接图,例如一个物体在另一个物体内部,或者一个物体遮挡了另一个物体的视线。
当用户提出问题时,系统并不仅仅是扫描视频以匹配关键词。相反,它会咨询这个记忆图谱,以寻找与查询相关的特定时刻。如果问题涉及一个隐藏的物体,系统会检索该物体最后一次可见的时刻以及导致其消失的事件。然后,它将这段历史总结成一段简洁的叙述,解释该物体的旅程及其当前可能的状况。这种摘要会与实际的视频剪辑一起被输入到 AI 模型中。通过提供这种明确的上下文,模型不再是在猜测,而是在基于重建的事件时间线进行推理。系统本质上是在告诉 AI:“你正在寻找的物体现在虽然不可见,但以下是它最后一次出现的位置以及发生的情况。”
研究人员发现,当视频较长且物体被隐藏较长时间时,这种方法效果最好。在涉及从几秒钟到一小时长短视频的测试中,StateTrace 框架的表现始终优于那些仅仅尝试压缩视频或检索相关片段的方法。在物体几乎被完全遮挡的重度遮挡情况下,改进最为显著。例如,在一个测试案例中,标准模型未能识别被巴士挡住后的汽车颜色,而是根据最后一帧可见画面进行了错误猜测。使用 StateTrace 后,模型能够从被遮挡前正确回忆起汽车的颜色,从而在视觉间隙中保持了场景的连续性。
为了确保研究结果的稳健性,团队进行了一系列实验,以观察其系统的哪些部分最为重要。他们发现,能够推理出物体为何消失的能力至关重要。如果系统只知道一个物体不见了,却不知道它是被遮挡了、移动了还是被藏在了某个东西里面,其表现就会显著下降。同样,总结空间关系和运动历史的步骤被证明是最关键的组成部分。如果没有这个摘要,AI 很难理解原始数据,就像一个人试图拼凑一个散落在地上的拼图碎片,而不是将其组装成一幅完整的画。系统还表明,仅仅将整个视频喂给 AI 是不够的;针对性地检索特定的、相关的时刻对于准确性至关重要。
StateTrace 的成功凸显了视频理解方法的一个根本性转变。多年来,研究重点一直在于让模型看得更清或处理更多的帧。这项工作表明,下一个飞跃来自于让模型更好地思考它们看不见的事物。通过将物体的不可见状态视为一个可解的谜题,而非缺失的数据,研究人员使 AI 能够处理现实世界的复杂观察。结果表明,通过正确的记忆和推理,机器可以开始弥合“所见”与“所知”之间的差距,而这种能力对于任何旨在应对现实生活中长期、连续流动过程的系统来说都是必不可少的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。