TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation
TokenTrim 通过引入一种在推理阶段识别并剪枝不稳定潜变量标记(latent tokens)的方法,在这些标记被重新用于条件控制之前将其剔除,从而解决了自回归长视频生成中的时间漂移问题,且该方法无需修改模型架构或训练过程,即可提高长时程的一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图向一位朋友讲述一个很长的故事,但你一次只能说一句话。为了让故事继续进行,你必须记住刚才说过的一切,才能让下一句话逻辑通顺。
问题:“坏记忆”效应
在 AI 视频生成领域,计算机也在做类似的事情。它以短片段(就像句子一样)的形式创建视频,然后利用刚刚生成的片段来生成下一个片段。这被称为“自回归”(autoregressive)生成。
该论文指出这一过程中存在一个主要缺陷,称为时间漂移(temporal drift)。想象一下你在讲一个关于白色卡车的的故事:
- 你说:“一辆白色的卡车在行驶。”
- AI 在第二个片段中犯了一个微小的错误,比如卡车看起来有点发灰。
- 在第三个片段中,AI 将这个“灰色的卡车”作为参考,所以它把卡车做得更深了。
- 到第十个片段时,卡车变成了黑色。到第二十个片段时,它甚至可能变成了一头牛。
AI 并不是脑力耗尽,它只是在重复利用自己的错误。每当它生成一个新片段时,它都会回顾之前的片段以获取上下文。如果这些之前的片段包含了“损坏”的信息(比如那辆灰色的卡车),AI 就会将这种损坏视为事实并向下传递,使错误不断恶化,直到视频彻底崩溃。
解决方案:TokenTrim(“编辑”)
作者提出了一种名为 TokenTrim 的新方法。把 AI 使用的视频数据想象成一叠便利贴(称为“Token/标记”)。有些便条上有正确的信息,而有些则含有“损坏”或不稳定的信息。
TokenTrim 就像一个聪明的编辑,在 AI 使用这些便条进行下一步之前对其进行检查。以下是其运作方式的简单解释:
- 检查: 在 AI 开始制作下一个片段之前,TokenTrim 会将新片段“想要”生成的摘要与刚刚完成的片段的摘要进行对比。
- 警报: 如果视频的某个特定部分(特定的“Token”或便条)看起来与之前相比发生了剧烈变化或极不稳定,系统就会标记它。这就像是注意到“白色卡车”的便条突然变成了“紫色大象”。
- 修剪: 与其使用那个错误的便条,TokenTrim 会将其丢弃(修剪)。它从 AI 的记忆库中删除损坏的信息。
- 重试: 随后,AI 被迫在没有那个错误便条的情况下生成新片段。它必须依靠剩余的、稳定的便条来决定下一步该做什么。
结果
通过在这些“坏记忆”(不稳定的 Token)污染下一步之前主动删除它们,视频保持了连贯性。卡车保持白色,人的脸部不会融化,背景也不会扭曲,即使视频运行了很长时间也是如此。
论文的核心要点:
- 无需重新训练: 这不是在教 AI 一种新的学习方式。它是一个“即插即用”的工具,可以在 AI 运行时直接使用。你不需要重新训练模型或更改其代码。
- 速度极快: 这个过程几乎不会增加制作视频的额外时间。它是一个快速的检查和一个快速的删除。
- 兼容现有技术: 论文在两种流行的视频生成方法(Rolling Forcing 和 Self Forcing)上测试了该方法,并证明了加入 TokenTrim 可以让视频效果更好、持续时间更长且不会崩溃。
- “首个片段”技巧: 作者还发现,专门针对“第一个片段”使用一种特殊技术有助于建立一个稳定的基础,使整个过程更加平滑。
简而言之
长视频生成之所以经常失败,是因为 AI 不断地回收并循环利用自身的错误。TokenTrim 通过充当质量控制过滤器来修复这个问题:它识别出 AI 记忆中的错误,将其删除,并迫使 AI 使用干净的数据重新开始。这阻止了错误的“滚雪球效应”,让视频能够更真实、更连贯地持续更长时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。