在数字世界中,一个无缝循环是连续性的一种微小奇迹。它是一个可以永恒播放而不会出现卡顿的视频,其最后一帧能完美地流回第一帧,从而创造出无限时间的错觉。你在各处都能看到这些循环:网站横幅上冒泡的气泡水、游戏背景中摇曳的草丛,或是社交媒体上的动态贴纸。几十年来,创建这些循环需要人类编辑费力地将素材拼接在一起,这是一个缓慢且昂贵的过程。最近,人工智能承诺实现这一过程的自动化,通过简单的文本描述生成视频。然而,当研究人员要求这些强大的 AI 模型创建一个完美的循环时,它们往往会失败。视频会出现卡顿、动作会冻结,或者结尾与开头无法匹配。问题不在于 AI 缺乏创造力,而在于它并不理解时间是如何呈环状运行的。
一支研究团队现在通过改变 AI 感知时间流逝的方式解决了这个谜题。他们发现,当前这一代依赖于被称为“Transformer”的复杂内部结构的视频生成 AI 模型,将时间视为一条直线。这些模型使用一种特定的机制来追踪每一帧在序列中的位置,就像一个人从一数到十那样计数。这对于有明确开头和结尾的电影效果很好,但当视频需要回到起点时,这种机制就会失效。研究人员发现,在这些 AI 模型内部,并非所有部分在追踪时间方面都同样出色。模型的某些层对帧的顺序要求非常严格,而另一些层则更加灵活。至关重要的是,他们识别出了一个特定的层,它作为整个系统的“主参考”或“锚点”。
由董浩天(Haotian Dong)及其同事领导的团队意识到,仅仅试图通过命令 AI 在结尾重复第一帧来强制实现循环是行不通的。AI 通常会采取阻力最小的路径,产生一张静止不动、没有动作的图像,或者在最后和第一帧之间产生剧烈的跳跃。他们没有强迫视频进行循环,而是决定改变 AI 的内部时间地图。他们开发了一种策略,以特定的方式调整了 AI 模型不同部分的计时信号。他们保持“锚点”层完全不变,以保留视频的含义和内容,确保 AI 仍然理解它正在讲述的故事。对于其他层,他们移动了计时信号,使得视频的结尾在数学上与开头相连。这把 AI 对时间的感知从一条直线转化为了一个完美的圆圈。
这种被称为“锚定位置嵌入偏移”(anchored position embedding shifting)的调整,让 AI 能够生成从开始到结束、再从结束回到开始都能自然流动的视频。当他们测试这种方法时,结果令人瞩目。AI 现在可以创建高质量的循环视频,例如武士挥剑攻击、带有冷凝水的可乐杯,或是狐狸跃过雪地,且动作没有任何可见的断裂。团队还展示了这项技术同样适用于具有透明背景的视频,这一特性对于需要将运动物体放置在不同场景之上(而非带有一个实心方框)的游戏开发者和数字艺术家来说至关重要。通过在这些新生成的循环小集上对 AI 进行训练,他们创建了一个能够产生多样且真实的运动,且没有以往尝试中出现的那些故障的系统。
这种方法的成功在于它尊重了 AI 的内部逻辑。研究人员并没有对抗模型将时间视为线性的自然倾向,而是利用锚点层作为一个稳定的参考点,同时温和地引导系统的其余部分进入循环模式。该方法已通过与其他现有技术的对比测试,并被证明在创造平滑、连续的运动方面更为优越。它允许生成的视频不仅视觉一致,而且细节丰富、动态十足。研究人员已向公众开放了他们的模型,为新一波数字内容的浪潮开启了大门——在这里,时间的边界是不可见的,循环是真正无缝的。