← 最新论文
💻 computer science

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

本文提出了去噪后检索网络(Denoise-then-Retrieve Network, DRNet),这是一种通过采用文本条件去噪模块来过滤无关视频片段,并利用文本重构反馈模块进行辅助监督的新型范式,从而在基准数据集上实现了最先进的性能。

原作者: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一段漫长且未经剪辑的家庭度假视频中寻找一个特定的场景。你有一个文本线索,比如“狗狗跳进泳池的那一刻”。在计算机科学领域,这项任务被称为视频时刻检索(Video Moment Retrieval)。它是人工智能的一个分支,通过让计算机学习理解图像和语言,从而精准定位长视频中事件发生的时刻。挑战在于,大多数视频都充满了“噪声”——数小时的风景、人们走来走去或与你的搜索无关的闲聊。如果计算机试图平等地分析视频中的每一秒,它会被这些无关的内容所淹没,就像试图在风吹乱整个草堆时,从其中寻找一根特定的针一样。研究人员一直试图构建更好的视频“搜索引擎”,但许多现有方法会被视频中的垃圾信息分散注意力,导致结果不准确。

这篇论文介绍了一种聪明的全新策略,称为**“先去噪,后检索”(Denoise-then-Retrieve)**。与其在杂乱的草堆中寻找针,作者提出了一个两步走的方案:首先,通过丢弃垃圾来清理草堆,然后再去寻找那根针。他们构建了一个名为 DRNet(去噪后检索网络)的系统,它扮演着智能过滤器的角色。在计算机尝试回答问题之前,它会利用文本查询扫描视频并生成一个“噪声掩码(noise mask)”。你可以把这个掩码想象成一副神奇的太阳镜,它能瞬间模糊掉视频中无聊或无关的部分(比如天空或路过的人),并高亮显示那些真正符合描述的片段(比如狗狗跳跃)。

该论文反对传统的方法,即计算机将视频中的每个片段都视为同等重要。作者指出,在大多数视频中,实际的“目标时刻”所占的时间不到 30%,而“噪声”片段占据了绝大部分。通过强制计算机先忽略噪声,系统可以将它的“脑力”集中在相关的部分。为了确保这种过滤工作正确运行,系统还内置了一个“自我检查”功能。它尝试仅使用清理后的视频片段来重写原始文本线索。如果重写的线索与原始线索不匹配,系统就知道它要么过滤掉了重要的内容,要么保留了过多的垃圾,并据此进行自我调整。

实验结果非常令人期待。在 Charades-STAQVHighlights 这两个流行的视频数据集上进行测试时,这种新方法在每一项指标上都超越了现有的最佳技术。例如,在 Charades-STA 数据集上,该方法比排名第二的竞争对手在寻找正确时刻的准确度上提升了 4.36 个百分点。作者还发现,这种“先清理,再寻找”的思想不仅适用于他们自己的系统;他们还可以将其接入其他现有的视频搜索模型,并使这些模型表现得更好。简而言之,这篇论文表明,在视频中寻找正确时刻的秘诀不在于更努力地观察一切,而在于学会忽略那些无关紧要的事物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →