← 最新论文
💻 computer science

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong 是一种无需训练、与架构无关的推理阶段方法,它通过流形约束的 Tweedie 匹配与随机早期阶段采样,将重叠滑动窗口进行融合以生成长视频,从而在不进行额外模型训练的情况下确保时间一致性与视觉保真度。

原作者: Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢的艺术家,能够绘制精美的高清场景,但他们有一条严格的规定:每次只能在一块明信片大小的画布上作画。如果你让他们绘制整部电影,他们就会感到疲惫,画风会发生变化,或者角色开始反复重复相同的动作。

这正是当前 AI 视频生成器面临的问题。它们擅长制作短片(就像明信片一样),但当你试图制作长电影时,质量就会崩溃,故事会偏离方向,或者动作变得机械且重复。

FlowLong 是一位新的“导演”,它帮助这些艺术家制作长电影,而无需重新训练他们或改变他们的风格。它通过两个巧妙的技巧来实现这一目标:重叠混合(Overlap Blend)全新开始(Fresh Start)

1. 重叠混合(Tweedie 匹配)

想象一下,你想绘制一幅长长的壁画,但你的艺术家每次只能绘制 10 英尺的段落。

  • 旧方法: 你让艺术家先绘制前 10 英尺,然后移动画布,再绘制接下来的 10 英尺。问题出在哪里?第一段的结尾可能与第二段的开头略有不同。颜色可能会发生偏移,或者角色的手臂可能处于不同的位置。
  • FlowLong 方法: 你告诉艺术家绘制前 10 英尺,但同时也要绘制接下来的 10 英尺,确保第一段的最后 2 英尺和第二段的前 2 英尺重叠
  • 神奇之处: FlowLong 从两个重叠部分中提取图像的“最清晰”版本,并将它们完美地融合在一起,就像电影中的无缝交叉淡入淡出效果。这确保了两个段落之间的过渡平滑且一致。它迫使两幅独立的画作就共享部分的外观达成一致。

2. 全新开始(随机早期阶段采样)

这里是棘手之处:即使你完美地混合了重叠部分,艺术家仍可能陷入“僵局”。如果他们在开始第二段时带着略微不同的想法,他们的大脑可能会重新回到原本各自独立的轨道上,导致电影在后期看起来支离破碎。

  • 问题所在: 想象一下两名徒步者从不同的路径出发。即使他们在桥上(重叠部分)相遇,由于“惯性”,他们可能会立即走回各自原本的路径。
  • FlowLong 解决方案: 在过程的开始阶段(当图像仍只是一团模糊的噪声时),FlowLong 会给艺术家一个温和的“摇晃”。它向混合中注入一点点新鲜的随机性(噪声)。
  • 结果: 这种摇晃打破了徒步者固守旧路径的习惯。它迫使两个独立的段落在他们仍然模糊时进行混合与交融。一旦它们就大致方向达成一致,FlowLong 就会停止摇晃,让它们确定性地(平滑地)走向终点。这确保了整部电影保持在同一轨道上,同时不失清晰、高质量的细节。

为什么这很重要

  • 无需重新训练: 你不需要教艺术家新技巧。你只需给他们一套关于如何组织工作的新指令。它开箱即用,适用于任何视频 AI 模型。
  • 多功能性: 它不仅适用于视频。论文表明,它还可以:
    • 同时生成视频和音频(就像带有配乐的电影)。
    • 将文本转化为3D 世界(根据描述创建 3D 场景)。
  • 更高质量: 与其他方法(虽然能生成长视频,但充满重复循环或漂移错误)不同,FlowLong 生成的长视频保持一致性、多样性且质量上乘。

总结

FlowLong 就像 AI 艺术家的智能制片经理。与其让他们独自挣扎着绘制长电影,不如将工作分解为重叠的片段,完美地融合边缘,并在开始时给予一点轻微的推动,确保他们始终步调一致。其结果是生成了长篇幅、连贯且高质量的视频,而无需重新训练底层的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →