InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter
本文介绍了 InfinityEdit,这是一种用于预训练视频生成器的轻量级适配器,它通过确保在无限序列的编辑请求中保持忠实的时序连续性和稳定的生成质量,实现了对流式视频进行无限制的、基于指令的编辑。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一场足球比赛的直播,突然间,你希望整个球场看起来像一幅水彩画,或者你希望摄像机突然从空中俯冲而下跟随足球。在人工智能的世界里,创造这样的变化通常是一个僵化的过程。现有的工具可以对一段简短的、已完成的视频剪辑进行修改,但它们将这段剪辑视为一个封闭的盒子。它们可以重写已经存在的内容,但无法轻易地触及未来去改变接下来会发生什么。如果视频继续播放,旧的规则就会失效,新的风格或摄像机角度也会随之消失。这种局限性使得编辑直播流或正在展开的故事场景变得非常困难。
一组研究人员通过开发一种全新的编辑“永不结束”视频的方法,解决了这一问题。他们将这种方法称为“无限视频编辑”。该方法不再强迫视频适应一个固定的时间段,而是允许人工智能应用一种变化——比如一种新的视觉风格或摄像机运动——然后生成自然延续这种变化的后续帧,使其能够永远持续下去。该系统不仅仅是在重写过去;它学会了将编辑向未来推进,确保即使在不断接收新指令时,视频也能保持一致性和高质量。
研究人员首先意识到,现有的视频编辑器基于一个简单的假设:视频已经完成了。它们获取一段源剪辑,并生成一个长度完全相同的编辑版本。这对于短片或社交媒体帖子效果很好,但对于连续的视频流(如一场现场比赛或监控摄像头画面)则会失效。在这些情况下,视频在不断增长。如果你想在视频播放中途改变风格,编辑必须延伸到出现的每一个新帧上。旧的方法无法做到这一点,因为它们旨在回顾静态剪辑,而不是面向开放式的流。
为了解决这个问题,团队首先构建了一种教计算机如何处理这一特定挑战的方法。他们创建了一个庞大的训练示例集。他们提取现有视频,并将其与如何改变视频的指令配对,例如“让这看起来像一本漫画书”或“让摄像机向下移动”。至关重要的一点是,他们不仅仅要求计算机改变现有的帧。他们生成了延续原始素材并应用了所请求变化的新视频片段。这教会了系统:编辑不仅仅是应用于快照的一个滤镜,而是一个故事走向的新方向。他们仔细过滤了这些数据,以确保生成的视频片段看起来真实,并且在不破坏场景流畅性的情况下正确应用了变化。
有了这些数据,他们引入了一个名为 InfinityEdit 的新系统。该系统的运作方式是在一个已经非常擅长制作长视频的强大视频生成器上,附加一个小型、轻量级的“适配器”。可以将主生成器想象成一位能够绘制连续图像的熟练艺术家,而适配器则是可以随时改变绘画风格的特殊画笔。主生成器保持“冻结”状态,这意味着它创建稳定、高质量视频的核心知识永远不会被改变。适配器是唯一学习的部分。它位于生成器和用户指令之间,准备在收到新的编辑请求时介入。
当用户发送指令时,适配器仅针对视频的一个短小片段激活。它获取指令和视频的近期历史,并生成一段应用了变化的新帧块。这个新生成的块充当了一个桥梁。一旦第一个编辑片段被创建,适配器就会关闭,由主生成器接管。因为主生成器现在将新编辑的帧视为其历史记录,它会自然地以新的风格或新的摄像机角度继续生成视频。编辑已经被“点燃”,系统会自动将其向前推进。这个过程可以无限重复。如果稍后收到第二个指令,适配器会再次唤醒以应用新的变化,然后生成器会从那里继续。
研究人员发现,这种方法解决了困扰长视频生成的两个主要问题。第一个是连贯性。在许多系统中,如果你尝试编辑一个正在生成的视频,变化往往会随着视频的进行而逐渐消失或丢失。新帧可能会漂移回原始的外观。InfinityEdit 通过在每次编辑发生时重置一个关键参考点来防止这种情况。这确保了视频始终锚定在最近的一次变化上,使风格或摄像机角度在视频持续进行期间保持稳定。
第二个挑战是质量。当计算机逐帧生成视频时,微小的错误可能会随时间累积,导致画面变得模糊或扭曲。研究人员训练他们的适配器来处理不完美的历史记录。他们刻意给系统提供了带有瑕疵的前序帧的示例,教会它如何恢复并产生清晰的结果,即使输入并不完美。这种训练使系统在经过多次编辑后仍能保持稳定,防止视频随着时间推移而退化。
在测试中,该系统成功地对正在进行的视频流应用了各种各样的编辑。它可以改变场景的视觉风格、改变摄像机运动或修改物体的外观,并随后在保持这些变化的同时继续生成视频。结果显示,视频能够忠实于指令,且不会漂移回原始状态。系统能够反复处理这些变化而不损失质量,证明了在视频进行时对其进行编辑是可行的,而无需等待视频结束。
这项工作为一种全新的视频交互方式打开了大门。用户不再是编辑一个成品,而是可以在视频创作的过程中引导它。无论是实时重新设计一场体育赛事的视觉风格,还是在长时录制过程中改变虚拟摄像机的视角,这项技术都提供了一种让编辑在故事展开时保持生命力的方式。研究人员通过展示将稳定的预训练生成器与灵活的轻量级适配器相结合,我们可以创造出不受时间限制的视频编辑工具,从而实现真正无限的创意可能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。