← 最新论文
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

本文介绍了 VideoSearcher,这是一个闭环智能体框架,它利用多工具推理和一种新颖的双支路序列策略优化(BiSPO)强化学习算法来推进视频深度研究,通过统一时间定位、空间聚焦和多模态搜索,并附带用于评估的新型 VideoSearch-QA 基准测试。

原作者: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图破解谜题的侦探,但你的“犯罪现场”不是一个犯罪现场,而是一段冗长、枯燥的视频。

问题:“封闭盒子”里的侦探
目前大多数视频 AI 模型就像是被锁在一个房间里的侦探,房间里只有这个视频文件。他们被告知:“你需要知道的一切都在这个视频里。”如果答案没有明确地写在视频里或显示在视频中,他们就会陷入困境。因为他们不被允许离开房间,所以无法去查阅一个名字、核对一个日期或验证一个事实。

解决方案:VideoSearcher
这篇论文介绍了一种新型的 AI 侦探——VideoSearcher,它被允许离开房间。它不把视频视为最终答案,而是将其视为一个线索

把 VideoSearcher 想象成一名带着智能手机、放大镜和地图的侦探。它是这样工作的,分步骤进行:

  1. 扫描犯罪现场(视频): 侦探观看视频。他不是一次性盯着整个视频看,而是知道如何快进到有趣的片段(比如寻找特定的角色),以及如何放大微小的细节(比如阅读车牌号或标志)。
  2. 请求支援(工具): 一旦他发现了线索(例如:“那看起来像是一个电子游戏里的角色”),他不会靠猜。他会使用他的工具:
    • 图像搜索: 他拍下线索的照片,并在互联网上搜索它到底是什么。
    • 网页搜索: 他阅读文章和维基百科,以获取关于该角色的事实(例如:“他们的特殊技能是什么?”)。
  3. 整合信息: 他将他在视频中看到的内容与他在互联网上找到的内容结合起来,得出最终答案。

秘诀:它是如何学习的
教 AI 做这件事很难。如果你只是告诉它“得到正确答案”,它可能会偶然猜对一次,但下次就会失败。作者创建了一种特殊的训练方法,称为 BiSPO(双分支序列策略优化)。

这就像是用两份不同的成绩单来训练一名学生:

  • 成绩单 A(答案): 你得到正确的最终答案了吗?
  • 成绩单 B(过程): 你使用了正确的工具吗?你是否在正确的位置进行了放大?你是否在正确的时间进行了搜索?

大多数 AI 训练只关心成绩单 A。VideoSearcher 则同时关心两者。这确保了 AI 不仅仅是在猜测答案,而是学会了成为一名优秀研究者的习惯。它学会了在获得足够信息时停止搜索,以及在遇到困难时加大搜索力度。

新测试:VideoSearch-QA
作者意识到旧的测试并不公平,因为它们只问那些仅凭视频本身就能回答的问题。因此,他们构建了一个新的测试集,名为 VideoSearch-QA

想象一下,有一个测试,给学生展示一段著名地标的视频,并问他们:“这个地标是什么时候开放的?”如果视频中没有显示带有日期的铭牌,那么学生必须知道去查阅资料。这个新的基准测试正是测试这一点:AI 能否在视频中找到线索,然后去公开网络上寻找剩余的答案?

结果
当他们将 VideoSearcher 与其他 AI 模型(包括免费的和昂贵的模型)进行对比测试时,它赢了。它在以下方面表现得出色得多:

  • 在长视频中寻找特定时刻。
  • 利用互联网来填补信息空白。
  • 解决需要同时进行“观察”与“搜索”的复杂问题。

总结
VideoSearcher 是一个已经从被动观察者晋升为主动研究者的 AI。它不仅仅是“观看”视频;它在调查视频,利用工具收集现实世界的证据,并破解以前计算机无法破解的谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →