← 最新论文
💻 computer science

AdaState: Self-Evolving Anchors for Streaming Video Generation

AdaState 引入了一种自进化的自适应潜在锚点,以替代自回归视频扩散模型中的静态首帧参考,通过将时间视为相对概念并将循环机制融入生成过程,从而实现更自然的场景演进和更丰富的运动表现。

原作者: Yusuf Dalva, Pinar Yanardag

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yusuf Dalva, Pinar Yanardag

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向朋友讲述一个漫长而连贯的故事,但你每次只能连续说三句话。每当你开始新一轮的讲述时,你都必须提醒朋友故事最初发生了什么,以免他们感到困惑。

在 AI 视频生成领域,情况正是如此。AI 逐帧(或按小片段)构建视频,为了保持故事的一致性,它严重依赖其生成的第一帧

问题:“冻结的锚点”

这篇论文将这种对第一帧的依赖称为“静态锚点”。这就像一座永不移动的灯塔。

  • 当前运作方式:AI 将第一帧视为终极真理。无论后续故事如何变化,AI 都会不断回溯第一帧,以此决定下一步该做什么。
  • 故障所在:由于 AI 过于执着于第一帧,它陷入了僵局。如果你让 AI 生成一段摄像机飞越城市的视频,AI 会因过度担心城市外观必须与第一秒完全一致,而拒绝让摄像机移动或让建筑物发生变化。
  • 结果:视频看起来像幻灯片,摄像机仿佛被粘在一个点上;更糟糕的是,AI 开始幻觉般地生成物体的奇怪复制品,因为它试图强行让新场景适应旧的、冻结的布局。这就像只盯着后视镜开车;你无法看到前方的路。

解决方案:AdaState(“自我演进的锚点”)

作者 Yusuf Dalva 和 Pinar Yanardag 提出了一种名为 AdaState 的新方法。他们不再使用一座冻结的灯塔,而是赋予 AI 一个鲜活、有生命的记忆

以下是 AdaState 的工作原理,使用一个简单的类比:

1. “幽灵”角色
想象 AI 正在写一个故事。通常,它会把主角的照片放在桌上,并拒绝更改。使用 AdaState 时,AI 会创建一个“幽灵角色”(即自适应状态)。

  • 这个幽灵永远不会向观众展示(它不会在最终视频中渲染出来)。
  • 然而,在故事的每一步,AI 都会根据刚刚发生的事件更新这个幽灵。
  • 幽灵将场景的“本质”向前传递。如果故事中太阳落山,幽灵会更新以反映日落,即使幽灵本身不是一个可见的角色。

2. 循环(回路)
在普通的视频 AI 中,“记忆”仅仅是一份过去帧的列表。而在 AdaState 中,记忆是一个过程

  • 这就像一场接力赛。第一名选手(第一帧)将接力棒交给第二名。但在 AdaState 中,接力棒在奔跑过程中会改变形状。
  • AI 不仅仅是复制过去;它在每一步都重新构想锚点。它会问:“鉴于我们现在的位置,‘锚点’应该是什么样子,才能让故事自然地继续下去?”
  • 这使得摄像机能够滑行、光线能够变化、场景能够演进,同时仍然感觉像是一个连贯的连续故事。

3. 为长远而训练
论文还发现,在训练这些模型时,AI 往往过于关注视频的开头(因为那部分简单且干净),而忽略了结尾(错误在那里堆积)。

  • 解决方法:他们使用了一种名为“地平线加权 DMD"的特殊训练技术。想象一位给试卷打分的老师,决定给试卷最末尾的答案额外加分。这迫使 AI 关注长期的连贯性,而不仅仅是开头。

结果

当他们测试这种新方法时:

  • 旧 AI:生成的视频要么非常稳定但枯燥(没有运动),要么非常动态但在几秒钟后就会崩溃成 nonsense。
  • AdaState:生成的视频既稳定又动态。摄像机可以飞越海岸线长达 30 秒,展现新的地形和变化的光线,而视频不会冻结或变成混乱的故障画面。

总结

该论文认为,要制作流畅的长视频,我们需要停止将第一帧视为永久性的规则手册。相反,我们需要一个“自我演进的锚点”,随着故事的进展不断更新自身。AdaState 通过隐藏一个特殊的、不可见的记忆槽来实现这一点,AI 不断刷新该记忆槽,使视频能够自然地向前推进,而不会失去其身份特征。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →