Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
该论文提出了 VideoTreeSearch (VTS),一种自纠错智能体框架,它将基于视觉定位的长视频问答建模为在具有显式回溯操作的自适应时间树上的迭代搜索,通过实现从早期错误中恢复,显著优于以往的方法,并在多个基准测试中取得了最先进的结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一部长达数小时的电影中寻找一个特定的、微小的瞬间。也许你需要看到厨师在将碗送入烤箱之前,究竟往里面添加了什么,但这段视频是一个完整的烹饪教程。如果你只是快速扫描整部电影,你可能会错过那个转瞬即逝的动作。但如果你以正常速度观看每一帧,那将耗费大量时间。这就是“落地式长视频问答”(Grounded Long-Video Question Answering)所面临的挑战。这项任务要求计算机不仅要回答关于长视频的问题,还要指出答案隐藏在哪几个精确的秒数里。
有一段时间,科学家们尝试通过给计算机一个“剪刀”工具来解决这个问题。计算机会猜测一个时间范围,在那里剪切视频并查看结果。如果它猜错了,它会尝试再次剪切。但这种方法就像是通过只能将干草堆对半剪开的方式来寻找干草堆里的针;如果你剪错了那一半,你就无法轻易回到另一侧重新尝试。你只会不断地把错误的那个部分剪得越来越小,直到放弃为止。这篇论文介绍了一种更聪明的搜索方式,它将视频变成了一张地图,计算机可以在上面进行探索、回溯并纠正错误,就像侦探破解谜案一样。
侦探的地图:VTS 如何破解视频之谜
认识一下 VideoTreeSearch (VTS),这是一个旨在帮助计算机成为专家级视频侦探的新型框架。该论文的研究人员意识到,旧的视频搜索方式过于笨拙。以前的方法就像是一个只能向前移动的人,通过不断裁剪视频片段来缩小范围。如果他们在早期犯了错——比如,他们认为答案在前十分钟,而实际上在最后十分钟——他们就会陷入困境。他们无法说:“等等,我走错方向了,”然后退回去尝试另一条路径。他们只会不断地在错误的坑里挖掘。
树的类比
为了解决这个问题,作者将视频转化成了一棵树。想象整个视频是巨大树木的树干。树干分裂成几根大树枝,代表主要的场景或章节。那些树枝再次分裂成更小的细枝,而细枝又分裂成微小的叶子。
- 树根: 整个视频。
- 树枝: 视频中发生场景变化的大块部分(例如从厨房移动到餐厅)。
- 叶子: 答案可能隐藏其中的微小、特定的瞬间。
至关重要的是,这棵树并不是由等大的切片组成的。相反,计算机观察视频,并在视觉故事发生变化的地方切割树木。如果一个场景持续五分钟,那么这个树枝就很长;如果一个场景只是一个快速闪过的瞬间,那么这个树枝就很短。这意味着树中的每个部分都作为一个有意义的故事单元,而不是随机的时间切片。
四种神奇的动作
一旦视频变成了一棵树,计算机代理就不再仅仅是“裁剪”了。它拥有四种特定的动作来导航这张地图:
- 放大 (Zoom In): 向下进入一个树枝,以查看视频中更小、更详细的部分。
- 缩小 (Zoom Out): 如果你意识到自己走得太深且方向错误,则回到父级树枝。
- 移动 (Shift): 在同一层级移动到另一个侧向的树枝(例如检查下一个房间,而不是当前的房间)。
- 回答 (Answer): 停止搜索,并给出带有精确时间戳的最终答案。
最令人兴奋的部分是 缩小 (Zoom Out) 和 移动 (Shift)。这些是“我做错了,让我们重来”的按钮。在旧的方法中,回退是不可能或非常困难的。在 VTS 中,回退是一个标准且内置的功能。代理可以深入一个错误的树枝,意识到这是一个死胡同,然后爬回上去,跳转到另一个树枝去寻找真相。
训练侦探
你不能只给计算机一棵树就指望它知道如何使用它。研究人员必须教导代理如何处理错误。他们创建了一个特殊的训练过程,其中他们故意引导代理走向错误的路径。
- 绕路 (The Detour): 代理会被引导去选择一个错误的树枝。
- 恢复 (The Recovery): 然后,它必须学会如何爬回来并找到正确的路径。
通过练习这些“绕路与恢复”的场景,代理学会了犯错并不是游戏的终点,而只是搜索过程的一部分。它学会了如果陷入困境,应该使用它的 缩小 (Zoom Out) 和 移动 (Shift) 工具来进行恢复。
结果
当他们在三个不同的视频问答挑战中测试这个新侦探时,结果令人印象深刻。
- 在 CG-Bench 测试中,与之前的最佳方法相比,VTS 将寻找正确时间间隔的能力提高了 12.5 个点。
- 在 Haystack-Ego4D 测试(使用极长视频)中,它提高了 7.4 个点。
- 甚至在不需要寻找精确时间的通用视频问题上,它的准确率也比其他方法高出多达 7.1 个点。
论文指出,这种“分层搜索”(按层搜索)是成功的秘诀。当他们移除 缩小 (Zoom Out) 或 移动 (Shift) 的能力时,性能显著下降。这证明了回溯的能力正是使该系统如此出色的原因。
为什么这很重要
作者发现 VTS 不仅仅是在猜测,它是在探索。平均而言,它需要大约 4.8 轮(步骤)来解决问题,而旧的方法通常在仅经过 1 或 2 轮后就会放弃。新的代理在大约 60% 的搜索中都会主动使用其回溯工具。它不仅仅是一个更快的计算器,更是一个聪明的探索者,它知道何时承认错误并尝试另一条路线。
简而言之,这篇论文表明,将长视频视为一个结构化的地图,而不是一个扁平的帧列表,可以让计算机以更高的准确度解决复杂问题。通过赋予它们回退和改变方向的工具,我们教会了它们如何更好地在干草堆中寻找那根针。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。