← 最新论文
💻 computer science

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

本文提出了\infty-RoPE 框架,通过引入块相对旋转位置编码、键值缓存刷新和旋转位置截断三项核心技术,在无需重新训练的情况下解决了现有自回归视频扩散模型在生成长度、动作控制及场景切换方面的瓶颈,实现了无限时长、精细可控且具有电影级转场的视频生成。

原作者: Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ∞-RoPE(读作“无限罗普”)的新技术,它的核心目标是让 AI 能够生成无限长动作可控像电影一样有剪辑感的视频。

为了让你更容易理解,我们可以把现在的 AI 视频生成模型想象成一个**“只会讲短故事的记性不好的说书人”**。

1. 现在的困境:说书人的三个“死穴”

目前的 AI 视频模型(说书人)有三个主要问题:

  1. 记性只有“一集”那么长(时间限制):

    • 现状: 大多数模型只能连续生成很短的视频(比如 5 秒或 10 秒)。一旦超过这个长度,它们就会“失忆”,画面开始扭曲、人物变形,就像说书人讲着讲着忘了前面讲了什么,开始胡言乱语。
    • 原因: 它们脑子里有一个固定的“时间坐标尺”,尺子只有那么长,尺子外面的故事它没法处理。
  2. 反应迟钝(动作控制难):

    • 现状: 如果你对着 AI 说:“现在让主角跳起来”,AI 往往反应很慢,或者跳不起来,因为它还沉浸在上一秒的“坐着”的状态里,很难瞬间切换。
    • 原因: 它把过去所有的记忆都背得死死的,改一个指令,它得把整本旧账都翻一遍,太慢了。
  3. 不会“转场”(无法剪辑):

    • 现状: 如果你想让视频从“白天”突然变成“黑夜”,或者从“室内”突然跳到“室外”,AI 通常只能让你看着它慢慢变(像延时摄影),无法实现电影里那种干脆利落的“切镜头”。
    • 原因: 它的逻辑是“时间必须连续流动”,无法理解“时间跳跃”。

2. ∞-RoPE 的解决方案:给说书人装上“三大法宝”

这篇论文提出了三个巧妙的技巧,不需要重新训练模型,直接在“讲故事的现场”就能解决问题。

法宝一:Block-Relativistic RoPE(相对论式时间尺)

  • 通俗解释: 把“绝对时间”变成“相对时间”。
  • 创意类比:
    • 以前: 说书人手里拿着一把固定的尺子,从第 1 秒量到第 1024 秒。一旦超过 1024 秒,尺子就断了,故事就崩了。
    • 现在(∞-RoPE): 我们换了一种方式。不管故事讲了多久,说书人只关注**“当前这一刻”“刚刚过去的几秒”**。
    • 想象你在开车,你不需要知道地球自转了多少圈(绝对时间),你只需要知道**“我离刚才那个路标还有多远”**(相对时间)。
    • 每当 AI 生成新的画面,它就把“时间尺”重新校准,让新画面永远处于尺子的“最佳位置”,而把很久以前的画面“折叠”起来,只保留它们的核心记忆(比如主角长什么样),而不纠结它们具体是第几分钟发生的。
    • 结果: 故事可以无限讲下去,永远不会因为“尺子不够长”而崩坏。

法宝二:KV Flush(记忆大扫除)

  • 通俗解释: 瞬间清空旧记忆,只留“定海神针”。
  • 创意类比:
    • 以前: 当你让 AI 从“走路”变成“跑步”时,它脑子里还塞满了“走路”的几千个细节,导致它转不过弯来。
    • 现在(KV Flush): 当新指令(比如“跑步”)进来时,AI 会立刻执行一次**“大扫除”**。
    • 它把脑子里关于“走路”的几千个细节全部扔掉,只保留两样东西:
      1. 全局锚点(Global Sink): 一个代表“整个场景基调”的定海神针(比如:这是一个公园)。
      2. 最后一帧(Last Frame): 主角刚才站的位置。
    • 结果: 就像你突然从“坐着”站起来,虽然你忘了刚才坐着的姿势细节,但你立刻就能开始“跑步”。AI 对指令的反应变得瞬间精准

法宝三:RoPE Cut(电影剪辑刀)

  • 通俗解释: 在时间轴上直接“剪一刀”,实现场景跳跃。
  • 创意类比:
    • 以前: 想要从“白天”变“黑夜”,AI 必须让太阳慢慢下山,过程很漫长。
    • 现在(RoPE Cut): 我们允许 AI 在时间轴上直接跳跃
    • 想象你在看视频,突然画面“切”了一下,直接跳到了下一个场景。AI 不再试图平滑过渡,而是直接告诉它:“好了,刚才那段结束了,现在把时间坐标直接跳到 100 秒后,开始讲新故事。”
    • 虽然时间跳了,但因为有了“法宝一”的相对时间机制,主角的脸和衣服依然保持不变,只是背景瞬间变了。
    • 结果: 实现了像电影一样的多场景剪辑,可以在一个视频里无缝切换不同的地点和时间。

3. 总结:这带来了什么?

简单来说,∞-RoPE 就像给现有的 AI 视频模型装上了**“无限续航的电池”“闪电般的反应神经”“专业的剪辑师”**。

  • 无限长: 它可以生成几分钟甚至几小时的视频,画面依然清晰稳定,不会像以前那样越往后越糊。
  • 听指挥: 你让它“跳”,它就立刻跳;你让它“停”,它就立刻停。
  • 像电影: 它可以轻松实现“上一秒在厨房,下一秒在月球”这种酷炫的转场。

最重要的是,这一切都不需要重新训练 AI,就像给旧手机升级了一个超级好用的“系统补丁”,让它瞬间拥有了生成好莱坞大片的能力。论文中的实验也证明,这种方法生成的视频在质量、连贯性和动态程度上都超过了目前最顶尖的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →