← 最新论文
💻 computer science

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

LiveAnimate 是一个新颖的实时、十亿级规模视频生成系统,该系统基于一个 14B 参数的扩散 Transformer(Diffusion Transformer),通过两阶段训练流水线和一种专门的姿态检索汇聚注意力机制(Pose-Retrieval Sink Attention mechanism),实现了具有恒定延迟和高感知质量的稳定、长篇流式人体动画生成。

原作者: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人跳舞。你给它一张人的照片和一段舞蹈动作的流数据,然后你希望机器人能立即生成一段该人正在跳舞的视频。这就是“姿态驱动的人体动画”(pose-driven human animation)的世界。长期以来,最优秀的机器人只能以“离线模式”完成这项工作。把它想象成烘焙一个复杂的蛋糕:你混合食材,等待数小时让它发酵,然后烘烤,最后才端上桌。如果你想改变舞蹈动作,你就必须重新开始整个烘焙过程。这对于制作电影来说很棒,但对于需要机器人“立刻”做出反应的直播或电子游戏来说却很糟糕。巨大的挑战在于,如何让一个机器人既拥有极高的智能(为了看起来真实且保持一致性),又拥有极高的速度(以跟上直播进度),同时还能保证视频在几分钟内不会崩溃。

LiveAnimate 的出现终于弥补了这一差距。研究人员构建了一个“数字舞者”,它可以逐块生成实时视频,展示一个人的舞蹈过程,同时确保在整个直播期间,这个人的面部和衣服看起来完全一致。这就像拥有一个永不疲倦、永不忘记木偶长相、且能让表演持续数小时而不让木偶脸部变形或衣服变色的现场操纵师。论文显示,该系统可以在强大的计算机上以约 20 帧每秒(这感觉像是实时运动)的速度运行,并能保持至少三分钟的高质量——而以往的方法要么无法实现实时运行,要么需要耗费数小时进行计算。

魔法技巧:它是如何工作的

要理解 LiveAnimate 是如何完成这个奇迹的,我们需要观察它混合在一起的三大主要成分:一个超级聪明的脑子、一套特殊的训练程序以及一个巧妙的记忆技巧。

1. 大脑:一个巨大的视频 Transformer
系统的核心是一个拥有 140 亿参数 的名为“扩散 Transformer”(Diffusion Transformer,简称 DiT)的庞大 AI 模型。想象一下,这是一个包含了人类身体所有可能运动方式和外观的巨大图书馆。通常,这些图书馆是“双向”的,意味着它们可以观察未来和过去来理解场景。但对于直播,你不能观察未来;你只能对“现在”正在发生的事情做出反应。研究人员必须重新训练这个巨大的大脑,使其变为“因果型”(causal),这意味着它只能观察过去和现在,就像一个正在实时观看舞蹈的人一样。

2. 训练:两个阶段的学习
你不能直接告诉一个拥有 140 亿参数的大脑“去直播”并指望它能正常工作。论文描述了一个两阶段训练过程来为它做好准备:

  • 第一阶段(老师): 首先,他们使用“参考锚定教师强制法”(Reference-Anchored Teacher-Forcing)来教导模型。想象一位老师拿着一份完美的剧本(地面真值/ground truth),引导学生(AI)逐块完成舞蹈。学生学习完美地模仿动作,同时始终牢记参考照片,从而确保舞者看起来就是那个人。
  • 第二阶段(速跑): 第一阶段仍然太慢了,无法实现实时化。因此,在第二阶段,他们使用了一种名为“分块自强制蒸馏”(Block-wise Self-Forcing Distillation)的技术。这就像是让学生在没有老师的情况下独自练习舞蹈,然后只对他们“当前正在做的动作”进行纠正。这使得模型能够从自己的错误中学习,而不需要在内存中一次性记住整个舞蹈的历史。结果呢?模型学会了仅用 3 步 而不是通常的 50 步就能生成高质量视频,这使其速度足以支持实时运行。

3. 记忆技巧:姿态检索汇聚(Pose-Retrieval Sink)
这是最具有创意性的部分。如果你要求一台计算机记住一段 3 分钟的视频,它通常会耗尽内存或变得混乱。如果舞者做了一个 2 分钟前做过的姿态,普通的系统可能会忘记他们在那个特定姿态下的样子,从而导致奇怪的故障或让脸部看起来略有不同。

LiveAnimate 通过一个被称为 姿态检索汇聚注意力(Pose-Retrieval Sink Attention, PR-Sink) 的巧妙记忆系统解决了这个问题。想象 AI 有一个小的“便签本”(滚动窗口),它只持有过去几秒钟的舞蹈。但它还有一个特殊的“姿态库”(Memory Bank),用于存储它之前见过的特定姿态的快照。

  • 静态汇聚(The Static Sink): 这是一个永久的锚点。它将视频的第一帧永远锁定在记忆中,确保舞者的身份永远不会发生漂移。
  • 动态汇聚(The Dynamic Sink): 这是神奇之处。当舞者做出一个与“姿态库”中匹配的姿态时,系统会立即抓取那个过去时刻的“便签”,并将其粘贴到当前的视图中。这就像舞者突然想起:“噢,我 2 分钟前做过这个动作,而且当时看起来很棒!”并瞬间复制了那个精确的外观。这一切的发生并不需要系统去记忆整个 3 分钟的视频,从而使无论直播进行多久,内存占用量都保持恒定。

结果:快速、稳定且真实

研究人员在一段三分钟的舞蹈序列上测试了 LiveAnimate。结果令人瞩目。虽然其他系统在生成同样的片段时需要 2 到 5 小时,或者在不到一分钟后就开始退化(脸部模糊、衣服变色或身份偏移),但 LiveAnimate 在整个三分钟内都保持了稳定的质量。

  • 速度: 在两块高端 NVIDIA H100 GPU 上,它的运行速度约为 19.63 帧每秒。这足以产生实时交互的感觉。
  • 一致性: 该系统在整个三分钟的过程中,在视觉质量和身份一致性方面保持了近乎完美的得分。相比之下,其他方法随着视频变长,其质量都会显著下降。
  • 效率: 得益于巧妙的“姿态库”技巧,无论视频是 10 秒还是 10 分钟,内存占用量都保持不变。

它目前还不是什么

论文谨慎地指出,该系统目前还不能做什么。它目前生成的视频分辨率为 480×480 像素,这对于屏幕显示很好,但达不到好莱坞电影级的质量。此外,它目前专注于单人场景,尚未处理多人共舞或复杂的相机运动。作者建议,将这些限制推向更高分辨率和更复杂场景是未来的研究方向。

为什么这很重要

LiveAnimate 代表了 AI 的一个新的运行点。它证明了我们不必在“高质量”和“实时速度”之间做选择。通过将庞大的 AI 大脑与智能的受限记忆系统相结合,研究人员创造了一个工具,它可以驱动下一代交互式化身、现场虚拟演唱会以及远程呈现系统,让数字人类能够即时地跳舞、交谈并与你互动,而永远不会忘记自己的身份。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →