← 最新论文
💬 NLP

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

本文介绍了 DemaFormer,这是一种新颖的基于 Transformer 的架构,它将基于能量的建模框架与阻尼指数移动平均机制相结合,以有效学习时刻查询分布,并在时序语言定位任务中超越最先进的方法。

原作者: Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一段长达一小时的家庭度假视频,有人要求你找出其中“戴墨镜的女子走过一座小型彩色桥梁”的确切 10 秒片段。这就是时序语言定位(Temporal Language Grounding)的工作:在视频中找出与句子相匹配的具体时刻。

本文的作者 Thong Nguyen 及其团队认为,目前用于完成这项任务的最佳工具有点像一位困惑的图书管理员。它们会查看视频和句子,但常常搞错“氛围”,将桥梁场景与附近某棵树的随机镜头混淆。

为了解决这个问题,他们构建了一个名为DemaFormer的新系统。以下是通过简单类比对其工作原理的解释:

1. 问题:“模糊”的搜索

将视频想象成一长列排队等待的人群,而“目标”就是你要找的那个人。

  • 旧方法:之前的 AI 模型使用标准的“注意力”机制。想象一下,AI 试图通过同时观察所有人来挑选出正确的人。问题在于,它常常分心。你想要的那个人(桥上的女子)最终看起来与站在她旁边的人(“剩余时刻”)非常相似。在论文的数据中,这些不同的场景被“搅混”在一起,使得很难将目标与背景噪声区分开来。

2. 解决方案:DemaFormer 的两大超能力

作者赋予了他们的新模型两个特殊技巧来解决这一混乱局面。

技巧 A:“阻尼”记忆(DEMA)

想象你正走在走廊里,试图记住你看到了什么。

  • 标准 AI:它查看当前的房间,然后查看下一个房间,将它们视为完全独立的快照。它没有意识到走廊将它们连接在一起。
  • DemaFormer:它使用了一种称为阻尼指数移动平均(Damped Exponential Moving Average, DEMA)的技术。将其想象为一种“智能记忆”,它既记住当前的房间,又温和地保留来自前一个房间和后一个房间的一小部分信息。
  • “阻尼”因子:这是秘诀所在。它就像一个音量旋钮。模型会学习到底要借用多少“邻居信息”。如果借得太多,场景就会模糊在一起;如果借得太少,就会错过上下文。“阻尼”旋钮让模型能够完美地调整这种平衡,使其知道:“好吧,这个桥梁场景与河流场景相连,但它仍然是独特的。”

技巧 B:“能量”过滤器(基于能量的建模)

现在,想象 AI 必须决定哪些视频片段是“好的匹配”,哪些是“坏的匹配”。

  • 旧方法:它只是试图根据以前看到的模式来猜测正确答案。
  • 新方法(EBM):作者将这种情况视为一个带有能量的物理实验。
    • 低能量 = 好的匹配:想象一个球滚入深谷。山谷越深,球就越稳定。模型希望正确的视频时刻处于“深谷”(低能量)中。
    • 高能量 = 坏的匹配:想象一个球栖息在摇摇欲坠的山峰上。它是不稳定的。模型希望错误的时刻处于“高峰”(高能量)上。
  • 训练过程:为了训练模型,他们使用了一种称为朗之万动力学(Langevin Dynamics)的数学过程。想象摇晃一盒弹珠。起初,弹珠(视频片段)全部混在一起。随着模型“摇晃”(训练),它将错误的弹珠(坏匹配)推到高而不稳定的山峰上,并让正确的弹珠(好匹配)滚入深邃、安全的山谷。这迫使模型清晰地将“桥梁”场景与其他一切区分开来。

3. 结果:更清晰的聚焦

该团队在四个不同的视频数据集(如日常 Vlog、新闻片段和体育集锦)上测试了 DemaFormer。

  • 视觉证据:在论文的图表(图 1)中,他们展示了 AI“观看”视频的方式图。
    • 旧模型(UMT):代表“桥梁”场景和“树木”场景的点都混杂在一个巨大、混乱的云雾中。
    • DemaFormer:“桥梁”的点形成了一个紧密、整齐的簇,与“树木”的点完全分离。这就像 AI 终于戴上了眼镜,能够清晰地看到区别。
  • 分数:DemaFormer 显著击败了之前的最佳模型(如 UMT 和 Moment-DETR)。它在找出视频片段的确切开始和结束时间方面表现更好,并且在将正确片段排名为第 1 选择方面也更出色。

总结

简而言之,DemaFormer是一个视频搜索引擎,它:

  1. 更好地记住上下文,通过温和地融合来自相邻时刻的信息(DEMA)。
  2. 学会将信号与噪声分离,通过将错误答案推向“高能量”(不稳定)区域,并将正确答案拉向“低能量”(稳定)区域(基于能量的建模)。

其结果是一个系统,能够比以前更准确地找到“那个过桥的女子”,而不会被她周围的景色所迷惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →