← 最新论文
💻 computer science

ID-VTG: Image-Disambiguated Video Temporal Grounding

本文引入了 ID-VTG,这是一个利用参考图像结合文本查询来解决视觉相似事件之间歧义性的视频时序定位新任务及基准,并提出了所提出的 VGD-Agg 框架,该框架通过利用双分支架构和专门的可学习标记来实现最先进的性能。

原作者: Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在每天充斥着屏幕的海量视频内容库中,计算机面临着一个持久的挑战:寻找特定事件发生的精确时刻。这项被称为“视频时序定位”(video temporal grounding)的任务,要求机器观看一段长片段,并指出一段由文字描述的场景的精确起始和结束时间。多年来,研究人员一直致力于训练仅使用文本的系统来完成这项工作。如果用户输入“那个人正在对着麦克风说话”,计算机就会扫描素材以寻找该动作。然而,当视频中包含多个相似的人或物时,这种方法就会遭遇瓶颈。如果两个穿着几乎相同制服的不同男子在不同时间对着麦克风说话,仅凭文本描述无法告诉计算机用户指的是哪一个。文字是模糊的,机器会因此迷失方向,经常猜错片段或根本无法找到正确的片段。

为了解决这个问题,北京大学的研究人员提出了一种全新的思考方式。他们意识到,在现实世界中,当人们不确定自己在谈论哪个人或物体时,通常会展示一张照片。保安可能会有一张嫌疑人的照片;体育迷可能会有一张特定运动员的快照。通过将文本描述与参考图像相结合,歧义便消失了。图像充当了一个严格的视觉过滤器,告诉计算机究竟要观察哪一个个体,而文本则描述了该个体正在做什么。这种被称为“图像消歧视频时序定位”(Image-Disambiguated Video Temporal Grounding)的新方法,将目标从基于文字的猜测转向了基于视觉匹配的精准定位。

研究人员不仅提出了理论,还构建了测试该理论所需的工具。他们创建了两个专门针对标准纯文本系统设计出的高难度视频数据集。第一个集合侧重于体操,其中的运动员穿着相同的制服并进行类似的动作。在这些视频中,同一个动作(如在高低杠上的大回环)可能由不同的人执行,或者由同一个人多次执行。文本可能会说“体操运动员进行了一个大回环”,但如果没有照片,计算机无法知道描述的是哪位体操运动员或哪次尝试。第二个集合则广泛得多,取材于来自互联网的各种视频,涉及动物、虚构角色和日常物品。在这里,挑战来自于不同的人执行相似的动作,例如两个不同的人在系鞋带。在这两个集合中,研究人员将每个文本查询都与特定目标的参考图像配对,从而创建了一个必须同时使用图片和文字才能获得正确答案的数据集。

为了处理这种新型任务,团队开发了一种模仿人类解决问题方式的方法。他们构建了一个具有两种不同观察方式的系统。一部分工作速度很快,扫描整个视频以生成一个潜在事件发生时刻的列表。这是“快速分支”,它创建了一个广泛的候选集。第二部分工作缓慢且细致,将视频的每一帧都与用户提供的参考图像进行对比。这个“慢速分支”寻找与照片相匹配的具体视觉细节,例如独特的面部特征或特定的衣服图案。

该系统的核心创新在于如何利用这两个部分来做出决策。研究人员引入了一种特殊的机制,其作用类似于“守门员”。当系统观察视频中的一个潜在时刻时,它会问一个简单的问题:这个部分的视频看起来像参考图像吗?如果答案是肯定的,系统就会高亮显示该时刻。如果答案是否定的,系统就会主动抑制该时刻,将其视为干扰。为了实现这一点,系统学会了识别“硬负样本”(hard negatives)——即那些看起来与目标非常相似、但实际上是错误的人或物。通过训练系统去区分真实目标与这些具有迷惑性的“长相相似者”,研究人员确保了计算机能够忽略视频中令人困惑的部分,而只专注于正确的片段。

这种方法的成果在新的数据集上进行了测试,并与现有的仅依赖文本的方法进行了对比。新系统表现出了显著的优越性。在视觉干扰极高的体操视频中,该系统成功识别了正确的运动员和正确的时间,而纯文本模型往往会失败。在包含广泛主题和动作的开放世界数据集中,即使在测试从未见过的视频时,该系统依然保持了准确性。这表明该方法学习到的是一种将图像与视频动作进行匹配的通用技能,而非仅仅是记忆特定的例子。研究人员还测试了系统处理低质量图像(如模糊或光照异常的图像)的能力。即使在这些困难条件下,系统依然保持了鲁棒性,能够持续找到视频中的正确时刻。

这项工作证明,为文本查询添加视觉参考不仅仅是一个微小的改进,而是机器理解视频方式的一次根本性转变。它使该领域从语言的局限性(语言可能是模糊或不精确的)转向一种更直接的交流形式,即通过图片来明确意图。通过创建一个能够有效过滤视觉干扰并专注于特定目标的框架,研究人员为实现更可靠的视频搜索和分析提供了路径。研究结果表明,对于需要在复杂、拥挤场景中追求精准的任务而言,照片加句子的组合是最有效的工具,它让计算机能够以仅靠文字无法实现的清晰度来看待世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →