VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
本文介绍了 VideoSearcher,这是一个闭环智能体框架,它利用多工具推理和一种新颖的双支路序列策略优化(BiSPO)强化学习算法来推进视频深度研究,通过统一时间定位、空间聚焦和多模态搜索,并附带用于评估的新型 VideoSearch-QA 基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜题的侦探,但你的“犯罪现场”不是一个犯罪现场,而是一段冗长、枯燥的视频。
问题:“封闭盒子”里的侦探
目前大多数视频 AI 模型就像是被锁在一个房间里的侦探,房间里只有这个视频文件。他们被告知:“你需要知道的一切都在这个视频里。”如果答案没有明确地写在视频里或显示在视频中,他们就会陷入困境。因为他们不被允许离开房间,所以无法去查阅一个名字、核对一个日期或验证一个事实。
解决方案:VideoSearcher
这篇论文介绍了一种新型的 AI 侦探——VideoSearcher,它被允许离开房间。它不把视频视为最终答案,而是将其视为一个线索。
把 VideoSearcher 想象成一名带着智能手机、放大镜和地图的侦探。它是这样工作的,分步骤进行:
- 扫描犯罪现场(视频): 侦探观看视频。他不是一次性盯着整个视频看,而是知道如何快进到有趣的片段(比如寻找特定的角色),以及如何放大微小的细节(比如阅读车牌号或标志)。
- 请求支援(工具): 一旦他发现了线索(例如:“那看起来像是一个电子游戏里的角色”),他不会靠猜。他会使用他的工具:
- 图像搜索: 他拍下线索的照片,并在互联网上搜索它到底是什么。
- 网页搜索: 他阅读文章和维基百科,以获取关于该角色的事实(例如:“他们的特殊技能是什么?”)。
- 整合信息: 他将他在视频中看到的内容与他在互联网上找到的内容结合起来,得出最终答案。
秘诀:它是如何学习的
教 AI 做这件事很难。如果你只是告诉它“得到正确答案”,它可能会偶然猜对一次,但下次就会失败。作者创建了一种特殊的训练方法,称为 BiSPO(双分支序列策略优化)。
这就像是用两份不同的成绩单来训练一名学生:
- 成绩单 A(答案): 你得到正确的最终答案了吗?
- 成绩单 B(过程): 你使用了正确的工具吗?你是否在正确的位置进行了放大?你是否在正确的时间进行了搜索?
大多数 AI 训练只关心成绩单 A。VideoSearcher 则同时关心两者。这确保了 AI 不仅仅是在猜测答案,而是学会了成为一名优秀研究者的习惯。它学会了在获得足够信息时停止搜索,以及在遇到困难时加大搜索力度。
新测试:VideoSearch-QA
作者意识到旧的测试并不公平,因为它们只问那些仅凭视频本身就能回答的问题。因此,他们构建了一个新的测试集,名为 VideoSearch-QA。
想象一下,有一个测试,给学生展示一段著名地标的视频,并问他们:“这个地标是什么时候开放的?”如果视频中没有显示带有日期的铭牌,那么学生必须知道去查阅资料。这个新的基准测试正是测试这一点:AI 能否在视频中找到线索,然后去公开网络上寻找剩余的答案?
结果
当他们将 VideoSearcher 与其他 AI 模型(包括免费的和昂贵的模型)进行对比测试时,它赢了。它在以下方面表现得出色得多:
- 在长视频中寻找特定时刻。
- 利用互联网来填补信息空白。
- 解决需要同时进行“观察”与“搜索”的复杂问题。
总结
VideoSearcher 是一个已经从被动观察者晋升为主动研究者的 AI。它不仅仅是“观看”视频;它在调查视频,利用工具收集现实世界的证据,并破解以前计算机无法破解的谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。