← 最新论文
💻 computer science

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground 是一种用于时序视频定位(Temporal Video Grounding)的新颖视频大语言模型,它通过引入用于整体语义连续性的特殊标记、用于降噪的 Savitzky-Golay 平滑处理以及用于克服现有依赖时间戳方法局限性的多粒度帧特征聚合,提升了事件定位的准确性。

原作者: Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

发布于 2026-02-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明的视频助手(一种“视频大语言模型”),它能够观看电影并回答关于电影的问题。然而,当你问它:“给我看那段猫咪打针的部分”时,这个助手经常难以找到准确的开始和结束时间。它可能会猜出猫咪出现的时刻,但却漏掉了针头真正触碰皮肤的那一瞬间,或者过早地停止了。

这篇论文介绍了一种名为 E.M.Ground 的新系统来解决这个问题。你可以把它想象成将助手从一个“秒表计时器”升级为了一个“讲述者”。

以下是 E.M.Ground 的工作原理,通过简单的类比进行解释:

1. 旧方法:两个独立的秒表

之前的方法(例如一个名为 E.T.Chat 的系统)试图通过使用两个独立的标记(tokens)(就像两个不同的秒表)来寻找答案。

  • 秒表 A 试图猜测事件何时开始
  • 秒表 B 试图猜测事件何时结束

问题所在: 这就像是通过只看电影的第一帧和最后一帧来寻找特定的场景。你忽略了中间发生的一切。如果电影很长,助手就会感到困惑,因为它忽略了故事的“肉身”(核心部分)。它经常选错开始或结束时间,因为它没有将整个事件理解为一个连续的故事。

2. 新方法:一个“故事标记”

E.M.Ground 改变了策略。它不再使用两个秒表,而是使用一个特殊的标记,称为 <evt>(意为“事件”)。

  • 类比: 想象你正在寻找书中的一个特定章节。与其分别询问“这一章从哪里开始?”以及“这一章在哪里结束?”,不如直接举起一个写着“整个章节”的书签。
  • 工作原理: 这个单一的 <evt> 标记会同时观察视频中的每一帧。它会问:“这一帧是否属于‘猫咪打针’这个故事的一部分?”它将故事连贯地保留在一起,确保助手将开始、中间和结束理解为一个连续且连贯的事件。这有助于它更好地处理长视频,因为它不会在中间迷失剧情。

3. 平滑掉“抖动”

即使有了新的“故事标记”,计算机的信心也可能会有些“抖动”。可能某一秒它 90% 确定某一帧属于该事件,但下一秒仅仅因为一个微小的视觉瑕疵,信心就降到了 40%,然后又跳了回来。

  • 类比: 想象一只手在颤抖着画图表上的线。线条上下波动得太厉害,导致很难看出真实的形状。
  • 解决方法: E.M.Ground 使用了一种称为 Savitzky-Golay 平滑处理 的数学技术。这就像是用一把温热的熨斗熨烫一件皱巴巴的衬衫。它能平滑掉那些细小的、带有噪声的褶皱(抖动),而不会改变衬衫的整体形状(实际的事件)。这有助于系统通过忽略噪声,更准确地选择开始和结束时间。

4. 重建丢失的细节

为了让视频更容易被计算机处理,系统通常会对视频进行“压缩”,从而丢弃一些视觉细节(比如把高分辨率照片压缩成缩略图)。这通常会导致计算机错过重要的线索。

  • 类比: 这就像试图通过一张模糊、低质量的照片来识别一张脸。
  • 解决方法: E.M.Ground 使用了多粒度特征(multi-grained features)。它不再仅仅盯着模糊的缩略图看,而是从不同细节层次(锐利的边缘、颜色、纹理)来观察照片,并将它们结合起来。这就像同时使用放大镜、广角镜头和色彩滤镜,以此来重建丢失的细节,确保计算机不会错过任何重要信息。

结果

论文在许多不同的视频数据集上测试了 E.M.Ground。

  • 更高的准确度: 它始终以显著优势击败了之前的最佳方法(如 E.T.Chat)。
  • 长视频表现: 当视频变长时,旧系统表现会变差,而 E.M.Ground 依然保持强劲,因为它理解的是整个故事,而不仅仅是开头和结尾。
  • 更少的错误: 它产生的错误极少,比如预测的时间与真实事件完全没有重叠,或者仅仅找到了事件的中段而错过了开头/结尾的情况。

总而言之: E.M.Ground 不再试图分别猜测开始和结束时间。相反,它将事件视为一个单一且连续的故事,通过平滑处理计算机的困惑,并利用所有可用的视觉细节来找到事件发生的精确时刻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →