← 最新论文
💻 computer science

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

本文介绍了 VG-GUIBench,这是一个用于评估基于多模态大语言模型(MLLM)的 GUI 智能体遵循视频教程能力的新基准,并提出了 TASKER,一种任务驱动且场景感知的关键帧提取算法,该算法显著提升了在 VideoQA 和视频引导的智能体任务上的性能。

原作者: Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图学习如何修理一台复杂的机器或玩一款新的电子游戏,但你手头唯一的说明书是一段长达三小时的视频。

如果你尝试从头到尾观看整个视频,你会感到厌烦,并且很可能会错过机械师展示如何拧开螺栓的那关键的一秒钟。如果你只是随机挑选一些秒数来看,你看到的可能只是机械师在走来走去或者盯着墙壁看,这对解决问题毫无帮助。

这篇论文介绍了一种让计算机更高效地观看这些长视频的新方法,它主要由两个部分组成:一个新的“测试”和一个新的“智能观察者”。

第一部分:新的测试 (VG-GUI-Bench)

作者注意到,目前的视频理解测试就像是在问:“你看到了多少辆红色的车?”或者“衣服是什么颜色的?”这些都是简单、浅层的提问。它们并没有测试 AI 是否真的能从视频中“学习一项技能”并在稍后使用它。

因此,他们构建了一个新的测试,名为 VG-GUI-Bench

  • 类比: 想象向 AI 展示一段关于“如何在手机 App 上修改密码”的视频教程。然后,你不是问一个常识性问题,而是要求 AI 实际进入另一个手机 App 并为你修改密码。
  • 目标: 这测试了 AI 是否能通过观看视频,理解分步操作流程,然后像人类代理(Agent)一样在电脑屏幕上执行该相同任务。

第二部分:智能观察者 (TASKER)

这些任务最大的问题在于,长视频充满了“废话”(冗余帧),而重要的部分往往隐藏在中间。如果你给 AI 输入太多的帧,它会感到困惑;如果你输入的太少,你又会错过重点。

作者创建了一个名为 TASKER(任务驱动且场景感知的关键帧搜索器)的工具。把 TASKER 想象成不是一个摄像机,而是一个非常聪明的侦探,或者是一个带着地图的徒步旅行者

以下是 TASKER 的工作原理,使用了几个类比:

1. 视频的“树”
TASKER 不是线性地(一秒一秒地)观看视频,而是将视频视为一棵

  • 它从整个视频的“树干”开始。
  • 它将视频分成大的块(树枝)。
  • 它不断地将这些块拆解成越来越小的部分,直到找到包含答案的精确“叶子”(帧)。

2. 两种类型的“智能”搜索
TASKER 使用一个特殊的 AI 大脑(一个 MLLM)来决定下一步探索哪根树枝。它使用两种不同的策略,就像侦探使用两种不同的线索一样:

  • “我在找什么?”策略(任务驱动): AI 会问:“我需要找到那个人输入密码的部分。视频中哪一部分看起来最像那个过程?”它会放大并聚焦于最相关的部分。
  • “发生了什么变化?”策略(场景感知): AI 会问:“哪里场景变化最大?”如果视频从厨房切换到了客厅,那就是一个巨大的变化。TASKER 知道,巨大的变化通常意味着有重要的事情发生,因此它会调查这些地方。

3. “知足即止”规则
大多数搜索算法运行直到达到一个硬性限制。TASKER 则更加聪明。它有一个内在的“置信度计”。

  • 在看了几帧关键帧后,AI 会问自己:“我有足够的信息来回答问题了吗?”
  • 如果它说:“是的,我 100% 确定了”,它会立即停止搜索。
  • 如果它说:“我还不太确定”,它就会继续深入挖掘。
  • 益处: 这意味着 TASKER 通常只需使用视频中 15% 的帧就能找到答案,而其他方法可能会浪费时间观看 100% 的视频。

结果

当作者在简单的视频问答和复杂的“学习技能”任务(VG-GUI-Bench)上测试这个“智能侦探”(TASKER)时:

  • 它的得分更高,超过了之前的最优方法。
  • 同时,它查看的帧数更少,这使得它运行起来更快、成本更低。

总结

简而言之,这篇论文认为:“目前的 AI 视频观察者要么太笨(抓不住重点),要么太慢(看遍一切)。我们构建了一个新的测试来观察 AI 是否真的能从视频中学习技能,并构建了一个新的‘智能侦探’(TASKER),它知道应该看视频的哪些部分来解决问题,从而忽略掉中间那些无聊的内容。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →