SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
本文介绍了 SMART,这是一个具有镜头感知能力的多模态框架,通过整合音频线索并采用镜头级标记压缩技术,提升了视频时刻检索的能力,并在基准数据集上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一段超长的、未经剪辑的家庭度假视频,你想找到那个“鲍勃叔叔一边拿着三明治一边讲笑话”的精确 30 秒片段。这个任务被称为视频时刻检索(Video Moment Retrieval)。这就像是在一个巨大的、移动着的草垛中寻找一根特定的针。
长期以来,计算机试图通过只观察视频中的图像来解决这个问题。它们会扫描每一个画面,试图将看到的景象与你的文本描述进行匹配。但这样做有两个大问题:
- 它们忽略了声音: 如果一个笑话之所以有趣是因为特定的音效或声音,那么只看画面的计算机可能会完全错过它。
- 它们会被信息淹没: 长视频拥有成千上万帧。许多帧仅仅是摄像机在缓慢平移,或者人们静止不动。扫描每一帧就像是在读一本每一页都和前一页几乎完全相同的书——这既浪费时间又浪费精力。
这篇论文介绍了一个名为 SMART(基于镜头感知的多模态音频增强时序段检索)的新系统来解决这些问题。把 SMART 想象成一个拥有两个特殊超能力的超级聪明视频剪辑师。
超能力 1:“耳朵”(音频增强)
大多数视频搜索工具就像是聋子;它们只关心它们能看到的东西。然而,SMART 拥有“耳朵”。
- 类比: 想象你正在寻找一辆警笛经过的片段。如果你只看视频,如果车离得很远或者被树挡住了,你可能会错过它。但如果你能“听到”警笛声,你就知道它确切发生的时刻。
- SMART 是如何做的: 它倾听音频轨道(说话声、警笛声、脚步声)并将它与视频结合起来。如果你的搜索查询提到了“说话”或“尖叫”,SMART 会利用声音来精准定位那个时刻,即使视觉线索模糊或具有歧义。
超能力 2:“智能跳过”(镜头感知 Token 压缩)
这是该论文中最具技术含量但也最聪明的想法。SMART 不再观察视频的每一帧,而是学会了智能地跳过无聊的部分。
- 类比: 想象电影中的一个场景,一个角色正在穿过房间。摄像机在他们身上停留了 10 秒钟。在这 10 秒内,角色的移动非常微小。普通的计算机可能会查看 300 帧这种重复的动作。
- SMART 的方法: 它意识到那个动作的第一帧是“关键帧”(Keyframe,即重要的那一帧)。接下来的 299 帧都是“非关键帧”(即冗余的副本)。
- “镜头(Shot)”的概念: 视频是由“镜头”组成的(在一次摄像机切换前连续拍摄的片段)。SMART 知道在一个镜头内部,事物通常看起来很相似。
- 压缩: SMART 保留“关键帧”的高清细节。但对于“非关键帧”,它并不是完全丢弃,而是将其缩小,仅保留那些实际发生变化的部分(比如挥手),并删除静态背景。这就像是通过保留主句并删除填充词来总结一段长段落。
它是如何协同工作的
- 听与看: SMART 同时获取视频和音频。
- 寻找镜头: 它将视频分解为若干个“镜头”(场景)。
- 挑选最佳帧: 在每个镜头中,它挑选出最重要的帧(关键帧)并保持其完整细节。
- 压缩其余部分: 它压缩那些不太重要的帧,去除“视觉噪声”,这样计算机就不会感到疲劳或困惑。
- 寻找时刻: 它利用结合了音频和视觉的线索,告诉你事件发生的准确时间(例如,“从 45 秒开始,到 52 秒结束”)。
结果
作者在两个大型视频数据库(Charades-STA 和 QVHighlights)上对 SMART 进行了测试。
- 更高的准确度: 它比以往顶尖的模型更频繁地找到正确的视频片段。例如,在一次测试中,它的准确度比排名第二的方法提高了约 2.6%。在视频搜索领域,这是一个巨大的飞跃。
- 更快、更聪明: 通过跳过冗余帧,它不需要消耗过多的计算机内存或处理能力,使其即使处理超长视频也十分高效。
总结
该论文声称,通过赋予计算机“耳朵”(去听取语境)并教会它“跳过无聊的部分”(通过基于场景切换的冗余帧压缩),我们可以比以前更准确、更高效地在视频中寻找特定时刻。这是在互联网无尽的视频海洋中进行搜索的一种更聪明的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。