← 最新论文
💬 NLP

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

本文介绍了 ToolMerge,这是一种新颖的关键帧检索方法,它利用大语言模型将查询分解为具体的工具调用,并通过布尔运算符合并其结果,在 newly proposed Molmo-2 Moments 基准测试中展现了具有竞争力的性能。

原作者: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一部长达 4 小时的电影,有人问你一个非常具体的问题,比如:“那个穿黄色夹克的人在过河之前正在做什么?”

如果你试图通过从头到尾观看整部电影来回答这个问题,那将耗费无穷无尽的时间。如果你只是随机挑选几帧画面(就像翻阅相册一样),你很可能会错过确切的那一刻。这正是该论文要解决的问题:如何在无需观看整段视频的情况下,精准定位长视频中包含答案的那几秒钟?

作者提出了一种名为 ToolMerge 的新系统。以下是通过简单类比对其工作原理的解释。

1. 旧方法的缺陷

以前的系统尝试通过两种方式解决这个问题,但两者都存在缺陷:

  • “一刀切”方法:它们将整个问题视为一个巨大的搜索词。这就像问图书管理员:“帮我找到那个穿黄色夹克的人过河的那一页。”图书管理员可能会找到有河的一页,或者有人的一页,但不一定能找到正确的组合。
  • “僵化清单”方法:它们试图将问题分解为固定的对象列表(例如,“找人”、“找夹克”、“找河”)。但现实生活是混乱的。有时你需要寻找一个动作,有时寻找一个物体,有时寻找一种特定的颜色。僵化的清单会忽略细微差别。

2. 解决方案:ToolMerge(聪明的侦探)

ToolMerge 就像一个聪明的侦探,懂得使用不同的工具来破案。它不是试图一步到位地找到答案,而是将任务分解。

步骤 1:规划者(大脑)
首先,“规划者”(一个 AI 大脑)阅读问题。它不是直接搜索整个句子,而是将问题分解为更小、更具体的任务。

  • 类比:如果问题是“那个穿黄色夹克的人做了什么?”,规划者不会只是对着虚空大喊“黄夹克!”。它会说:“好的,我需要三样东西:1. 找到有河的场景。2. 找到穿黄色衣服的人。3. 找到有人正在涉水而过。”

步骤 2:工具(专家)
规划者将这些小任务发送给不同的“专家”工具。

  • 工具 A (SigLIP):这是场景专家。它观察整幅画面以寻找整体氛围(例如,“一条河”、“一个峡谷”)。
  • 工具 B (T-REN):这是物体专家。它放大画面以寻找具体的事物(例如,“一个人”、“一件黄色夹克”)。
  • 工具 C (OCR):这是文本阅读器。它读取视频中标志或屏幕上出现的任何文字。

步骤 3:合并(法官)
现在,每个工具都根据其特定任务对视频的每一帧进行了排名。“合并”步骤将这些排名结合起来。

  • “与”规则:如果问题要求同时有河和人,系统会寻找两个工具都给出高分的帧。这就像一个维恩图;答案必须位于圆圈重叠的中间部分。
  • “或”规则:如果问题问“他过河了还是过桥了?”,系统会寻找满足任一条件的帧。

最后,系统根据所有这些组合规则选出得分最高的 3 到 8 帧,并将其交给最终的“回答者”AI 以给出实际答案。

3. 新测试:Molmo-2 Moments (M2M)

为了证明他们的系统有效,作者意识到现有的测试是不公平的。旧测试中的问题可以通过猜测或查看视频的随机部分来回答。

他们建立了一个名为 Molmo-2 Moments (M2M) 的新测试。

  • 类比:想象一位老师,他仅根据电影中一段特定的 10 秒片段来出题。老师确切知道这 10 秒内发生了什么。如果学生答对了,他们必须观看了那特定的 10 秒。他们不可能从电影的其他部分猜出答案。
  • 这确保了如果系统答对了,它实际上确实找到了正确的帧。

4. 结果

当他们测试 ToolMerge 时:

  • 在寻找正确帧方面,它比以前的方法更好,特别是对于涉及多个物体或动作的复杂问题。
  • 它在字幕检索方面表现尤为出色。如果你给系统一段关于场景的长篇详细描述(如字幕),与旧方法相比,ToolMerge 能更好地找到与该描述完全匹配的确切视频片段。
  • 他们还表明,如果使用特定的奖励系统(GRPO)对规划者进行一点“训练”,它在知道使用哪些工具方面会变得更好。

总结

ToolMerge 是一个不试图一次性猜出长视频问题答案的系统。相反,它像一个项目经理:它将问题分解为小的、具体的任务,将这些任务发送给不同的专业工具,然后结合结果,以找到包含真相的确切几秒钟视频。他们通过创建一个新的、更严格的测试证明了其有效性,在该测试中,答案被锁定在特定的时间点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →