← 最新论文
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

本文介绍了 DyMoS,一种无需训练且与模型无关的方法,它通过在注意力机制中重新平衡参考帧的主导地位来增强图像到视频生成中的运动动态,从而在不损害视觉保真度或无需额外训练的情况下克服运动抑制问题。

原作者: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models》(DyMoS)的通俗解释,辅以生动的类比。

问题:视频的“冻结”现象

想象你有一张马的照片,并让计算机将其转化为马奔跑的视频。你原本期待看到马在奔腾,但当前的 AI 模型往往对原始照片过于“客气”。它们会让马保持静止,最多只是微微抖动耳朵,因为它们太害怕改变你提供的图片了。

论文将这种现象称为“静态运动偏差”(Static Motion Bias)。AI 过于专注于保持第一帧(参考图像)的完美,以至于忘记了让视频的其余部分动起来。

发现:“过度专注”的学生

研究人员深入探究了这些 AI 模型的工作原理,发现了一种特定的行为,他们称之为“参考帧主导”(Reference-Frame Dominance)。

把 AI 模型想象成一个正在参加考试的学生:

  • 文本提示是题目:“让马跑起来。”
  • 参考图像是桌上放着的那匹马的照片。

在普通的文本转视频(Text-to-Video)模型中,学生会看着题目,脑海中想象奔跑的马。
而在图像转视频(Image-to-Video)模型中,学生死死地盯着桌上的照片。每当学生试图绘制视频的下一帧时,他们都会看着照片说:“好吧,我必须让这一帧看起来和照片完全一样。”

因为学生如此痴迷于复制照片,他们从未真正画出马在奔跑的样子。“照片”主导了“想象力”。

解决方案:DyMoS(“运动滑块”)

研究人员开发了一种名为 DyMoS(动态运动滑块)的工具。它不需要重新训练 AI,也不需要修改原始照片。相反,它就像一个调节学生“痴迷程度”的音量旋钮。

它是如何工作的:

  1. 干预措施:在生成视频的最初几个时刻(即“去噪”步骤),DyMoS 会轻轻拍一下学生的肩膀。它说:“嘿,别那么死盯着参考照片了。你现在需要去想象运动。”
  2. 机制:从技术上讲,它调整了 AI 注意力系统中的特定数值(即“偏差”)。当 AI 决定下一帧应该是什么样子时,它会略微降低参考图像标记(tokens)的得分。
  3. 结果:AI 仍然可以看到图片(所以马看起来还是那匹马),但它不再被强迫完美复制它。这释放了 AI 的能力,让马得以奔跑、汽车得以行驶、水花得以飞溅。

“滑块”功能

DyMoS 最酷的地方在于它是一个滑块,而不仅仅是一个开关。用户只需调节一个数值:

  • 调低(负数值):AI 会对照片更加痴迷。视频会变得更加静止(如果你想要一张几乎不动的静态图,这很有用)。
  • 调高(正数值):AI 被指示更多地忽略照片的“冻结”特性。视频会变得更加动态和充满活力。
  • 中间地带:你可以找到完美的平衡点,让视频自然运动,同时角色看起来依然与你开始的原始照片完全一致。

为何优于以往的方法

以往试图解决这种“视频冻结”问题的方法,就像试图通过砸坏引擎或给车轮喷漆来修车一样。

  • 有些方法需要重新训练整个 AI(昂贵且缓慢)。
  • 其他方法试图模糊或破坏输入图像以强制产生运动,但这往往会让视频看起来丑陋或扭曲。

DyMoS 之所以不同,是因为:

  1. 无需训练:你不需要教 AI 任何新东西。你只需在 AI 工作时使用该工具。
  2. 模型无关:它适用于几乎所有现代视频 AI(如 Wan 2.2、HunyuanVideo、CogVideoX)。
  3. 保持质量:它能让视频动起来,而不会让图片变得模糊或怪异。

总结

该论文指出,图像转视频模型对其输入图像“过于客气”,导致视频枯燥且静止。他们通过 DyMoS 解决了这一问题。这是一个简单的工具,就像一个音量旋钮,只需将 AI 对起始照片的痴迷程度稍微调低,就能让运动发生,而无需更改模型或原始图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →