← 最新论文
💻 computer science

GeoMag: Geometric-Aware Video Motion Magnification via State Space Model

本文介绍了 GeoMag,这是一个利用状态空间模型实现全局一致且线性复杂度放大的几何感知视频运动放大框架,并辅以全新的 Geo-200K 数据集,以解决现有方法在结构一致性和训练多样性方面的局限性。

原作者: Kecheng Han, Yuchen Zhang, Bingqing Liu, Boqiang Guo, Wenbin Zheng, Shiyuan Pei

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kecheng Han, Yuchen Zhang, Bingqing Liu, Boqiang Guo, Wenbin Zheng, Shiyuan Pei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一段蜂鸟翅膀或振动机器部件的视频。在肉眼看来,这些运动如此微小,看起来就像是一团模糊或仅仅是静态噪声。视频运动放大(VMM) 就像一台“运动显微镜”,试图将这些不可见的微小抖动放大到我们可以看见的程度。

然而,将这些微小运动放大并非易事。如果你只是简单地调大运动的“音量”,你也会同时放大“静态”(噪声),并且经常破坏画面,导致物体看起来摇晃或失真。

本文介绍了一种名为GeoMag的新工具,它解决了这些问题。以下是其工作原理,使用简单的类比来说明:

1. 问题:“模糊”与“破碎”的两难困境

以往的方法尝试通过两种主要方式来放大运动,但两者都存在缺陷:

  • 局部侦探(CNNs): 这就像侦探一次只观察一个小房间。它们速度很快,但不知道房子里其他部分发生了什么。这会导致局部失真,即图像的某些部分看起来扭曲变形。
  • 全局观察者(Transformers): 这就像拥有整个城市无人机视角的侦探。它们能完美地看到全局,但它们运行起来太慢且成本太高,无法实时处理高清视频。

GeoMag 找到了“金发姑娘”式的完美区间:它既能看到全局(保持全局一致性),又能像局部侦探一样快速运行。

2. 秘密武器:"Mamba"引擎

GeoMag 使用了一种名为状态空间模型(具体为一种称为Mamba的变体)的新型 AI 架构。

  • 类比: 想象你在读一本书。旧方法(Transformers)试图一次性阅读每一个单词,并将每个单词与书中的其他所有单词进行比较,以理解故事。这非常缓慢。
  • GeoMag 的方法: 它按线性顺序逐词阅读,但它拥有“选择性记忆”。它记住重要的情节要点(实际运动),并立即忘记页面上的随机涂鸦(相机噪声)。这使得它能够理解整个故事(整个视频帧)而不会陷入困境,从而变得极其快速和高效。

3. 训练场:"Geo-200K"

AI 模型需要基于示例进行训练,以学习如何在不破坏画面的情况下放大运动。

  • 旧方法: 大多数以前的模型都是在物体仅沿直线移动(如汽车向前行驶)的视频上进行训练的。这就像只教飞行员在笔直、空旷的跑道上飞行。
  • 新方法(Geo-200K): 作者构建了一个名为Geo-200K的大型新训练数据集。他们创建了一个“虚拟游乐场”,其中的物体不仅直线移动,还会旋转、扭曲和转动。他们还添加了逼真的“相机故障”,如颗粒感和模糊。
  • 结果: 这就像让那位飞行员在狂风骤雨和急转弯中进行训练。现在,当 GeoMag 面对现实世界的视频时,它不会被复杂的运动或相机噪声所震惊。它确切知道如何处理这些情况。

4. GeoMag 如何工作(双流厨房)

该系统有两位“厨师”协同工作,共同烹制最终的视频:

  • 厨师 1(运动专家): 这位厨师使用 Mamba 引擎来寻找运动部分。他们捕捉微小的运动,将其放大(使其变大),然后利用“选择性记忆”平滑掉任何锯齿状边缘或噪声。他们确保运动物体保持刚性,而不会变成一团模糊。
  • 厨师 2(细节专家): 这位厨师专注于背景和静态细节(如墙壁或衬衫的纹理)。他们的工作是确保在运动放大的同时,画面的其余部分不会变得模糊或失去清晰度。
  • 最终菜肴: 他们将各自的工作结合起来。你得到的视频是运动巨大且清晰,但背景保持锐利,且物体看起来没有融化。

5. 结果

该论文将 GeoMag 与现有的最佳方法进行了测试:

  • 质量更优: 它生成的视频更清晰,伪影(如波纹或破碎形状等奇怪的视觉故障)更少。
  • 速度更快: 它比使用“全局观察者”(Transformer)方法的最先进先前方法快约5 倍
  • 更稳健: 因为它是在复杂的Geo-200K数据集上训练的,所以它处理旋转物体和噪声相机的能力远优于仅在简单直线运动上训练的模型。

总之: GeoMag 是一种新颖、快速且智能的方法,用于放大视频中不可见的运动。它利用巧妙的“选择性记忆”系统来保持画面稳定,并利用超级增强的训练数据集,确保即使在物体旋转或相机抖动时也能正常工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →