← 最新论文
🤖 machine learning

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

本文提出了 Holmes,一种分层证据学习框架,该框架通过基于视频间狄利克雷相似性建模和基于自适应最优传输的视频内软对齐来聚合多粒度跨模态证据,从而显式地对部分相关视频检索中的不确定性进行建模。

原作者: Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图从成千上万段视频组成的庞大图书馆中,找到一段特定的、未经剪辑的家庭录像。你手中只有一张简短而模糊的便条作为线索,比如“一个人在游泳”。

这就是**部分相关视频检索(PRVR)**所面临的挑战。视频本身漫长且杂乱(未经修剪),但你的便条仅描述了其中极短的一个瞬间。问题在于:你的便条过于简短,可能会意外匹配到数十段不同的视频;或者它过于模糊,导致计算机完全无法理解你在寻找什么。

本文介绍了一种名为Holmes(以著名侦探命名)的新系统来解决这一问题。Holmes 不像传统方法那样仅猜测“是”或“否”,而是像侦探一样自问:“我对这个结论有多确定?”

以下是 Holmes 的工作原理,辅以简单的类比:

1. 问题所在:“模糊便条”与“嘈杂图书馆”

本文指出了两个导致难以找到正确视频的主要问题:

  • 模糊便条(视频间歧义): 如果你写下“一个人在游泳”,计算机可能会找到一段人在泳池游泳的视频、一段在海洋游泳的视频,以及一段有人假装游泳的视频。计算机之所以困惑,是因为这条便条能对应太多事物。
  • 嘈杂图书馆(视频内稀疏监督): 在一段长视频中,只有几秒钟真正符合你的便条。其余部分只是背景噪音(人们走动、交谈等)。传统方法往往只关注单个“最佳”片段而忽略其余部分,这就像试图仅通过观察一帧模糊的画面来评判整部电影。

2. 解决方案:“侦探的工具箱”

Holmes 使用一种称为证据学习(Evidential Learning)的特殊数学方法。它不是给出单一分数,而是收集“证据”并计算它对该证据的信任程度

部分 A:整理线索(视频间层面)

Holmes 审视那条“模糊便条”,并依据“三分原则”将其分为三类:

  1. 精确线索: 便条清晰(例如,“一个女孩正在系她的红色芭蕾舞鞋”)。Holmes 非常有信心。它将此视为确凿的指纹。
  2. 多义线索(双关语): 便条具有多重含义(例如,“一个男人在跑”)。这可能是慢跑者,也可能是逃亡的罪犯。Holmes 意识到:“我不确定你指的是哪一种”,因此它不强行给出单一答案,而是保持多种可能性开放。
  3. 未定线索: 便条太短或残缺(例如,“游……")。Holmes 承认:“我没有足够的信息来解决这个问题。”它不会胡乱猜测,而是承认缺乏证据。

魔法技巧: 一旦 Holmes 整理好线索,它就会调整“训练规则”。如果线索模糊,它会告诉计算机:“对于那些‘差不多’正确的视频,不要过于苛刻。”如果线索精确,它则说:“严格一点,找到完全匹配的视频。”这防止了计算机因模糊的便条而陷入困惑。

部分 B:清理视频(视频内层面)

现在,Holmes 深入长视频内部,寻找特定的瞬间。

  • 旧方法: 想象一下,试图仅通过观察最匹配的那一帧画面,将一句话与视频进行匹配。如果那一帧是故障或随机噪音,整个搜索就会失败。
  • Holmes 的方法(柔性最优传输): Holmes 使用一个“垃圾桶”。想象你在整理衣物。你有一堆衣服(视频片段)和一份需求清单。
    • 大部分衣物放入“匹配”堆。
    • 但有些衣物只是垃圾或无关紧要(比如一只不配套的袜子)。
    • Holmes 拥有一个特殊的垃圾桶。它不会强迫那只垃圾袜子去匹配你的清单,而是将其扔进垃圾桶。这使得计算机能够只关注视频中相关的部分,而不被中间的“噪音”分散注意力。

3. 结果:更聪明的侦探

通过结合这两个步骤,Holmes 在查找视频方面比之前的方法更加出色。

  • 它不仅仅说“这段视频匹配”。它会说:“这段视频匹配,我有 90% 的把握”,或者“这段视频匹配,但便条很模糊,所以我只有 60% 的把握”。
  • 它忽略了那些会让其他系统感到困惑的视频“垃圾”部分。

总结

可以将之前的视频搜索引擎想象成一个死记硬背答案但遇到棘手问题就会困惑的学生。Holmes则像一位侦探,它:

  1. 承认线索何时过于模糊(因此不会猜错)。
  2. 根据线索的清晰程度进行分类(因此知道该投入多少精力去查找)。
  3. 扔掉垃圾(视频中无关的部分),以便专注于真正的证据。

本文表明,这种方法能帮助计算机在搜索便条简短、杂乱或模糊的情况下,更快、更准确地找到正确的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →