← 最新论文
🤖 machine learning

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

本文提出了 Memory-V2V,一种通过外部记忆机制将历史编辑作为结构化约束引入视频扩散模型的框架,有效解决了多轮视频编辑中跨轮次一致性的难题,在保持视觉质量的同时显著提升了迭代编辑的连贯性。

原作者: Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Memory-V2V 的新系统,它解决了视频编辑中一个非常令人头疼的问题:“记性不好”

想象一下,你正在用 AI 编辑一段很长的视频。你想把视频里的苹果变成橙子。

  • 第一轮:你把前 10 秒的苹果变成了橙子,效果很好。
  • 第二轮:你想把中间 10 秒的苹果也变成橙子。
  • 第三轮:你想把最后 10 秒的苹果也变成橙子。

现在的 AI 模型(旧方法)就像是一个“金鱼记忆”的画家:
当你画第二轮时,它只盯着你给的指令(“把苹果变橙子”),却完全忘了第一轮画出来的橙子长什么样。结果,第二轮的橙子可能变成了红彤彤的,第三轮的又变成了青绿色的。虽然它们都是“橙子”,但看起来完全不像是同一个东西,视频看起来支离破碎,非常奇怪。

Memory-V2V 就像是一个“拥有超级记忆和整理术的资深剪辑师”:
它不仅能听懂你的指令,还能记住之前每一轮编辑出来的样子。当你开始第二轮编辑时,它会回头看看:“哦,上一轮我画的是这种橙色的橙子,这一轮我也得画成一样的。”


核心功能:它是如何做到的?

为了不让这个“剪辑师”累死(因为视频数据量太大,全记下来算不过来),Memory-V2V 用了两个聪明的招数:

1. 聪明的“找资料” (智能检索)

如果每次编辑都要把以前所有的视频片段都翻出来看,效率太低了。

  • 比喻:想象你在图书馆找书。如果你要写关于“苹果”的文章,你不需要把图书馆里所有关于“水果”的书都搬过来,你只需要找最相关的那几本。
  • 做法
    • 如果是改视角(比如从左边看变成从右边看):系统会计算“视野重叠度”。就像你转头看风景,系统会问:“刚才那个角度和现在这个角度,看到的景色有多少是重合的?”只把重合度高的旧视频找出来参考。
    • 如果是改内容(比如把苹果变橙子):系统会看“长得像不像”。它会把当前要编辑的片段和以前编辑过的片段做对比,只把长得最像的片段找出来参考。

2. 灵活的“记笔记” (动态压缩)

找出来的旧视频也不能全部原封不动地塞给 AI,那样会把它“撑爆”(计算量太大)。

  • 比喻:想象你在做笔记。
    • 对于非常重要的参考片段(比如刚才那个完美的橙子),你把它详细地画下来,连纹理都画清楚(高分辨率)。
    • 对于不太重要的片段(比如背景里模糊的树),你只画个大概的轮廓或者写几个关键词(低分辨率/压缩)。
  • 做法:系统会自动判断哪些旧视频片段对当前任务最重要。重要的保留细节,不重要的就“压缩”一下。这样既省了算力,又保证了关键信息不丢失。

3. 自动“合并同类项” (自适应合并)

  • 比喻:如果你有一堆完全一样的旧照片,你不需要把它们全部贴在本子上,只需要贴一张,然后在旁边备注“这里还有 10 张一样的”就够了。
  • 做法:系统发现某些旧视频片段对当前的生成没什么影响(AI 的注意力机制显示它们不活跃),就会把它们“合并”成一个更小的数据包,进一步减少计算负担。

这个系统有什么用?

论文里主要展示了两个场景:

  1. 360 度全景视频编辑(视频新视角合成)

    • 场景:你拍了一段视频,想看看如果摄像机从左边、右边、上面拍会是什么样。
    • 效果:以前,AI 每次换个角度拍,生成的画面里物体可能会“变脸”(比如刚才的杯子是圆的,换个角度变成方的了)。现在,Memory-V2V 能确保不管怎么转,杯子的形状和颜色都始终如一
  2. 超长视频的文字编辑

    • 场景:你想把一段 5 分钟的视频里所有的“苹果”都变成“橙子”。
    • 效果:以前,AI 只能一段一段地改,导致视频前半段是红橙子,后半段是青橙子。现在,Memory-V2V 能像一条连贯的流水线,确保整段视频里的橙子长得一模一样,而且背景也不会乱跳。

总结

Memory-V2V 的核心思想就是:把“过去的编辑结果”变成“未来的约束条件”

它不再把每一次编辑看作是一次全新的、孤立的创作,而是看作一个连续的、有记忆的对话过程。通过“只找最相关的旧资料”和“聪明地压缩记忆”,它让 AI 在编辑长视频或多次修改时,既能保持极高的画质,又能保证前后风格的一致性,就像一位真正记得住所有细节的顶级剪辑师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →