← 最新论文
💻 computer science

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

本文介绍了 STAR 框架,该框架为多模态大语言模型配备了一个全面的视频工具包和一个策略性调度机制,以增强时空推理能力,从而在 VideoMME 和 LongVideoBench 等具有挑战性的 VideoQA 基准测试上实现了显著的性能提升。

原作者: Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过一段非常长且混乱的视频来破解一个谜题。你有一位才华横溢的侦探(一个 AI 模型),他极其聪明,精通语言理解并擅长观察图像。然而,这位侦探有两个致命弱点:

  1. 他会被信息淹没: 如果你给他看一段 10 分钟的视频,他会试图查看每一秒钟的内容,这会让他在处理时变得缓慢且混乱。
  2. 他不擅长缩放和定位时间: 他很难精准地确定某个事物在视频中的确切位置(空间)或在事件序列中的确切时刻(时间)。他经常在还没通过寻找证据进行艰苦调查之前,就直接猜出了答案。

论文《用于简化视频问答的时空推理工具增强技术》(Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering)提出了一个名为 STAR(时空推理框架)的解决方案来解决这个问题。

侦探的新工具箱

与其只是让侦探去瞎猜,作者给了他们一个 视频工具箱——一个专门的工具箱。把这些工具想象成侦探的装备包:

  • 空间工具(Spatial Tools): 这些工具就像放大镜或摄像机变焦。它们可以找到特定的物体(比如拖拉机),在它周围画个框,并放大以阅读指示牌上的微小文字。
  • 时间工具(Temporal Tools): 这些工具就像时间轴或视频编辑器。它们可以扫描整个视频并说明:“拖拉机只出现在第 2 分钟到第 3 分钟之间”,从而剪掉那些毫无意义的冗长部分。
  • 通用工具(General Tools): 这些是“全能型”助手,比如一个能够阅读笔记并给出最终答案的总结器。

问题所在:“走捷径”的习惯

作者注意到,如果你只是把这个工具箱交给侦探并对他说,“去解决它”,侦探往往会采取一种 捷径。他并没有使用工具循序渐进地寻找证据,而是最后又看了一眼整个视频,然后直接猜出了答案。这被称为 “工具链捷径”(Toolchain Shortcut)。这种方式很快,但往往是错误的,因为侦探并没有真正进行调查。

解决方案:STAR 策略

为了阻止侦探作弊,作者制定了一套严格的规则,称为 STAR

想象侦探正在试图从一段拥挤的体育场视频中找到一个特定的人。

  1. 旧的方法: 侦探看着整个体育场,感到困惑,然后给出一个猜测。
  2. STAR 的方法:
    • 第一步(时间): 侦探首先使用 时间工具 来确认:“好吧,那个人只出现在视频的 2:00 到 2:30 之间。” 他忽略了视频的其他部分。
    • 第二步(空间): 现在,仅观察这 30 秒的片段,他使用 空间工具 来确认:“啊,那个人在屏幕的左上角区域。” 然后他将镜头对准那个位置进行放大。
    • 第三步(重复): 他不断地在两者之间切换。“等等,他可能移动了?让我们再检查一下时间。” 然后,“好,现在让我们仔细观察那个位置。”

这种 交替进行(在时间和空间之间切换)的方法迫使侦探逐步缩小搜索范围,就像一个 3D 搜索灯在寻找特定的“3D 感兴趣区域(3D Region of Interest)”。由于规则强制要求他们循序渐进地收集证据,他们无法走捷径。

结果

作者在几个视频测试集上,用这个新侦探(STAR)与其他著名的 AI 模型进行了对比测试:

  • 它更聪明: 通过使用这些工具,该系统在其中一项主要测试(VideoMME)中答题准确率提升了 8.2%,在另一项测试(LongVideoBench)中提升了 4.6%,表现优于单纯使用强大的 GPT-4o 模型。
  • 它更快: 因为系统明确知道应该看视频的哪些部分,它处理的帧数大大减少。它不再是观看整部电影,而只观看重要的场景。这使得它的运行速度更快,成本更低。
  • 它击败了竞争对手: 尽管该系统使用的是相对轻量化的工具,但它超越了那些试图一次性记住所有内容的庞大 AI 模型。

简而言之

这篇论文认为,要让 AI 擅长理解视频,你不应该仅仅是让 AI 变得“更聪明”或“更大”,而应该给它 专门的工具,并强制它按照 严格的、循序渐进的顺序(时间,然后空间,再时间,再空间)来使用这些工具。这可以防止 AI 偷懒走捷径,并帮助它通过只关注视频中最相关的部分来找到确切答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →