← 最新论文
💻 computer science

Conformal Coverage Guarantees for Any Video Temporal Grounder

本文介绍了 COVER,这是一个事后(post-hoc)、模型无关的框架,它通过发布具有有限样本、无分布假设保证(包含真实事件时刻)的时间区域,将任何视频时序定位器转化为可靠的预测器,从而解决了当前系统中固有的事件边界歧义性以及缺乏可靠性度量的问题。

原作者: Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看电影,有人问:“英雄最后什么时候抓住了反派?”你可能会指向一个开始时间和一个结束时间。但如果你请十个不同的朋友在同一段剪辑中标记这些精确时刻,你很可能会得到十个不同的答案。有些人会说追逐战早了一秒开始;有些人会说结束得晚了几秒。在计算机视觉领域,这被称为“视频时序定位”(video temporal grounding)。这项任务的目标是教会计算机根据一段文本描述在视频中找到特定的时刻。困难之处在于,“正确”答案并不是时间轴上的一个单一、完美的线段,而是一个模糊的可能性云团,因为人类的感知本质上是具有歧义性的。

目前,大多数计算机程序表现得像是绝对确定一样。它们在时间轴上画出一个单一的框,并说:“就是这个!”但如果这个框错了,计算机不会发出任何警告。这就像一个天气应用说:“下午 2:00 会下雨”,但没有告诉你它可能在 1:55 开始,或者在 2:10 结束。如果你是一个试图编辑视频的机器人,或者是一个试图寻找特定片段的搜索引擎,你不仅需要知道事件发生的位置,还需要知道计算机有多确定。这篇论文通过赋予计算机一种能力来解决这个问题:让它能够说,“我有 90% 的把握该事件发生在这一更宽、更安全的区域内”,而无需重新训练计算机或窥探其内部大脑。

问题所在:这种“自信”的错误

这篇论文的作者们(与 Kurban Intelligence Lab 合作)注意到视频 AI 工作方式中的一个巨大鸿沟。当计算机尝试在视频中寻找一个时刻时,它通常会输出一个单一的时间区间(一个开始时间和一个结束时间)。问题在于,“地面真值”(ground truth)——即实际的正确答案——通常是一个分布,这意味着不同的人可能会标记出略有不同的时间。由于计算机只给出一个答案,错误的预测看起来和正确的预测完全一样。如果你正在构建一个依赖这些预测的工具,你无法知道何时该信任计算机,以及何时该扩大搜索范围。

一些研究人员试图通过训练模型来预测自身的确定性,或者仅仅是添加一个固定的时间量(一个“边距/margin”)来修复这个问题。作者认为这些方法是有缺陷的。固定边距就像是为所有人准备了同样尺寸的鞋子;它们可能非常适合一个孩子,但对于成年人来说可能太大了,或者对于巨人来说太小了。在测试中,他们发现仅仅选择一个随机的边距可能会导致计算机在不同视频中的准确率在 10% 到 100% 之间剧烈波动。其他试图从零开始学习不确定性的方法也往往无法提供它们所承诺的可靠性,有时甚至在声称有 80% 把握时,连真实的时刻都错过了。

解决方案:安全外壳(Cover)

于是有了 Cover,这是这篇论文中描述的一种新工具。请不要把 Cover 仅仅看作一个新的“大脑”,而要把它看作一个智能的安全外壳,你可以把它套在任何现有的视频查找程序之上,无论它是一个复杂的、经过训练的模型,还是一个你无法看到内部结构的黑盒 AI。

它是如何工作的呢?我们可以用一个简单的类比:想象你正试图用网(计算机的预测)捕捉一条滑溜溜的鱼(真实的事件)。计算机投出的网通常很接近,但有时会漏掉鱼尾或鱼头。Cover 并不改变计算机投掷手臂的力量。相反,它观察计算机在一组已知视频上的练习过程(一个“校准集”)。它测量出计算机的网需要扩张到什么程度,才能每次都能捕捉到那条鱼。

一旦它确定了要达到(例如)90% 的捕获概率所需的扩张程度,它就会将这种扩张应用到每一个新的预测中。如果计算机说事件发生在 10 秒到 20 秒之间,Cover 可能会说:“好吧,为了保证 90% 的把握,我们设定实际范围在 8 秒到 22 秒之间。”这个新的、更宽的区域被保证能以你要求的概率包含真实的事件。

研究发现

研究人员在三个不同的视频数据集和五种不同类型的视频查找程序上测试了这个“外壳”。他们的结果非常具有启发性:

  1. 它有效: 当他们要求 90% 的保证时,系统实现了 90% 的成功率。“实现覆盖率”(即实际正确的频率)几乎完美地追踪了目标值。
  2. 固定边距失效: 他们测试了另一种旧观点,即在没有校准的情况下直接添加固定时长(比如“增加 10 秒”)。结果是混乱的。根据视频和模型的不同,成功率剧烈波动,从低至 0.096(不到 10%!)到 1.000(100%)不等。这证明了你不能仅仅靠猜测安全边距;你必须进行校准。
  3. “证据型”陷阱: 他们测试了一种专门设计用来预测自身不确定性的特殊 AI。尽管这种 AI 声称有 80% 的把握,但其实际正确率仅为 66%。然而,Cover 采用了该 AI 完全相同的预测,并通过套上一层新的图层,确实实现了有效的 80% 保证。这表明即使是专门构建来处理不确定性的模型,在预测其自身不确定性方面也可能是错误的。
  4. 不对称性很重要: 他们发现,有些模型擅长判断事件何时开始,但对何时结束却表现得很差。对于这些模型,Cover 发现需要向后方(结束端)进行更大的扩张,而不仅仅是向前方(起始端)。通过允许外壳不对称地扩张两侧,他们可以使安全区域更加紧凑且高效。

总结

论文得出结论,对于视频时序定位而言,“正确”的答案不是一个单一的时间点,而是一个带有置信度陈述的区域。Cover 提供了一种获得该区域的方法,而无需重新训练 AI 或获取其内部代码。它将任何视频查找工具转变为一个可以表达“我不是 100% 确定,但我 95% 确定事件在这个框内”的工具,并且它能用数学逻辑支撑这一说法。

作者强调,只要新视频与用于练习的视频具有相似性(这是一个被称为“可交换性/exchangeability”的概念),该保证就会成立。如果新视频与练习集完全不同,保证可能会减弱,但该方法仍然提供了一种衡量和调整的方法。最终,Cover 将一场猜谜游戏变成了一个可靠的、经过校准的过程,确保当计算机指向视频中的某个时刻时,我们确切地知道可以给予多少信任。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →