← 最新论文
🤖 machine learning

Incentivizing Vision Language Models to Search for Long Video Question Answering

该论文介绍了 VSeek,这是一个通过采用带有神经符号奖励的强化学习来增强长视频问答能力的智能体框架,旨在将该任务转化为一个多轮搜索过程,从而系统地根据形式化时序逻辑规范验证检索到的视觉证据。

原作者: Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你手里拿着一部两小时长的纪录片,被问到一个非常具体的问题,比如:“那个男人在掉落花瓶时戴着什么颜色的帽子?”

旧方法(被动感知):
目前的 AI 模型通常通过从整部电影中随机抓取一小把帧来尝试回答这个问题——也许是均匀分布的 64 个快照。这就像试图通过随机抓起一把干草来在一堆干草中寻找一根特定的针。如果那根针不在这一把干草里,AI 就会进行猜测,由于错过了关键时刻,它经常会猜错。

新方法 (VSeek):
这篇论文介绍了一种名为 VSeek 的更聪明的 AI 智能体,它的行为更像是一名人类侦探。它不再是随机猜测,而是主动“回溯”视频时间轴。它会思考:“我需要找到花瓶掉落的部分,”然后利用自然语言去搜索那个特定的场景。这就像拥有一个聪明的助手,知道如何使用视频播放器的“查找”功能,直接跳转到相关的时刻,然后再进行回答。

问题所在:我们如何教会 AI 进行良好的搜索?
训练一个优秀的 AI 侦探是非常困难的。通常,我们只告诉 AI 最终答案是对还是错(就像老师在考试结束时评分一样)。但如果 AI 搜索了错误的内容却仍然因为运气好而得到了正确答案,它就会养成坏习惯。它需要关于其“如何搜索”的反馈,而不仅仅是最终结果的反馈。

解决方案:VETL(“视觉单元测试”)
为了解决这个问题,作者创建了一个名为 VETL(通过时序逻辑获取视觉证据)的系统。把这想象成将问题转化为一份清单或一个食谱

  1. 拆解过程: 该系统将复杂的问题分解为微小的、不可辩驳的事实(原语)。

    • 问题: “她在倒入热水后,在酸奶上放了什么?”
    • 清单:
      1. 有一名女性出现。
      2. 她在倒热水。
      3. 她在舀酸奶。
      4. 她添加了配料。
      5. 配料是可见的。
  2. 奖励机制: 当 AI 搜索视频时,系统会检查它的“收据”(即它找到的片段)。它找到了倒水的片段吗?它找到了酸奶吗?如果 AI 找到了与清单相匹配的片段,它就会获得一个“加分”(奖励),甚至在给出最终答案之前。

这就像一款视频游戏,你通过收集特定的物品来获得积分,而不仅仅是通过击败最终 Boss 来获得积分。这教会了 AI 变得细致且精准。

结果:
通过使用这种“清单”方法来训练 AI,VSeek 在长视频中寻找正确答案的能力变得更强了。

  • 与那些只是猜测或随机搜索的模型相比,它的准确率显著提高。
  • 它学会了提出更好的搜索问题(例如,搜索“草莓配料”而不是仅仅搜索“食物”)。
  • 它变得更加高效,观察的帧数整体减少了,因为它知道确切要找什么,而不是盯着整部电影看。

总结:
这篇论文提出了 VSeek,一种不再是被动观看视频,而是像侦探一样主动搜寻答案的 AI。为了教会它如何有效地搜寻,作者发明了 VETL,一个将问题转化为严格的视觉事实清单的系统。这让 AI 能够获得关于其是否正在收集正确证据的即时反馈,从而在处理长视频时给出更聪明、更准确的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →