← 最新论文
💻 computer science

DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation

DySink 是一种基于检索的自回归长视频生成框架,它用动态选择的视觉相关历史帧取代静态早期帧锚点,并采用汇点异常门控机制以防止注意力坍塌,从而同时提升动态连贯性与时间质量。

原作者: Bo Ye, Xinyu Cui, Jian Zhao, Tong Wei, Min-Ling Zhang

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Ye, Xinyu Cui, Jian Zhao, Tong Wei, Min-Ling Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图讲述一个长达一小时的故事,却只有一本非常小的笔记本用来书写。每当你写下一句新句子,就必须擦掉一句旧句子以腾出空间。

问题:“旧照片”陷阱
当前的 AI 视频生成器面临类似的问题。为了高效地生成长视频,它们采用了一种技巧:将少数“锚点”帧(例如视频的第一帧)永久保留在内存中,同时不断替换其余部分。

这就像一位导游被困在盯着旅行起点照片的状态。尽管团队已经步行数英里深入丛林,导游却仍指着停车场的照片说:“还记得这个吗?”

  • 结果: 视频陷入停滞。场景变化不足,或者更糟的是,视频突然跳回开头,造成一种怪异的循环故障,使故事重置。论文将这种现象称为“汇点坍塌”(Sink Collapse)。之所以发生,是因为 AI 过度痴迷于那些陈旧、静态的锚点,而忘记了中间发生的有趣内容。

解决方案:DySink(智能图书管理员)
作者提出了一种名为 DySink 的新系统。DySink 不再固守相同的旧照片,而是像一个拥有动态记忆库的智能图书管理员

  1. 动态检索: 当 AI 需要回忆过去以保持故事连贯时,它不会仅仅抓取书本的第一页。相反,它会审视当前的场景,并问道:“过去的哪一部分与此刻发生的最相似?”随后,它会从记忆库中调取那些具体且相关的页面。

    • 类比: 如果你此刻正在沙漠中骑马,AI 不会查看视频开头的一张鱼的照片,而是会找到 10 分钟前那张马的照片,以保持故事的流畅。
  2. “异常门控”(安全检查): 有时,即使是聪明的图书管理员也可能出错,调出一页导致故事循环或故障的页面。论文引入了一种特殊的“安全门”。

    • 类比: 想象 AI 拥有一个由 100 名编辑(注意力头)组成的团队。如果这 100 名编辑突然齐声尖叫:“快看那张旧照片!它是最重要的!”安全门就会猛然关闭。它会说:“停下!所有人一致认同某件旧事物,通常意味着我们即将犯错。”随后,它会忽略那张旧照片,转而坚持近期且安全的记忆。

结果
论文在长达一分钟的视频上测试了该方法。

  • 旧方法: 视频经常陷入循环,或看起来像是退回到了开头。
  • DySink 方法: 视频自然演进。角色和场景随时间变化(更高的“动态度”),同时不失故事的连贯性(更高的“时间质量”)。

总结
DySink 解决了 AI 视频被困在过去的问题。它不再强迫 AI 永远凝视视频的开头,而是让 AI搜索记忆中最相关的时刻以保持故事流畅。它还增加了一个安全开关,防止 AI 过度痴迷于任何单一记忆,从而避免视频出现故障并重置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →