Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars
Avatar-Forever 是一个解耦的并行训练框架,它结合了用于实现高视觉质量的全参数蒸馏与通过面向恢复的展开训练(Recovery-oriented Rollout Training)训练的轻量化长时程适配器,从而能够在单块 H100 GPU 上实现稳定、实时且无限的音频驱动化身生成。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个你可以与一位数字朋友交谈的世界,他看起来、行动起来、说话方式都和真人一模一样,而且能永远陪伴你。这不仅仅是科幻电影中的梦想;这也是一个被称为视觉计算(visual computing)领域的终极目标,科学家们正致力于教计算机理解并创造动态图像。为了实现这一目标,研究人员使用了AI模型——这些是基于数百万个视频训练出的庞大数字大脑——来学习人类的外貌与动作。该领域的一个关键挑战是流式视频生成(streaming video generation)。把它想象成一场接力赛:计算机生成几秒钟的视频,然后将这个结果作为接下来几秒钟的起点,以此类推。问题在于,如果计算机在最初几秒钟内犯了一个微小的错误,这个错误就会沿着线路传递下去,随着每一步的推进而变得越来越大、越来越诡异,直到那个数字人开始融化或忘记自己的身份。这篇论文解决了如何让这些数字人在即使连续说话数小时的情况下,依然保持完美外观和自然动作的难题。
开发 Avatar-Forever 的研究人员意识到,试图用旧方法来解决这个“接力赛”问题,就像是试图通过一个单一且混乱的教学计划,去教一个学生既要跑得快又永远不绊倒。旧的方法试图将两个截然不同的目标挤进同一个训练过程中:让视频生成速度极快(以实现实时感),以及让它极其稳健(以免在短短一分钟后就崩溃)。作者认为,这两个目标实际上是在相互竞争。如果你过于关注速度,视频就会变得抖动;如果你过于关注修复错误,速度就会变得太慢。
因此,Avatar-Forever 并没有强迫计算机同时学习这两项技能,而是将训练分成了两个独立的并行类别。想象一下一个数字健身房,拥有两条不同的赛道。在第一条赛道上,效率分支(Efficiency Branch),AI 练习的是短跑。它学习如何在仅需极少数步骤的情况下生成高质量视频,专注于速度以及短期内的视觉效果。在第二条赛道上,鲁棒性分支(Robustness Branch),AI 练习的是另一种技能:恢复。在这里,研究人员故意破坏 AI 的起始点——模糊图像、添加噪声或遮挡脸部——然后要求 AI 照常生成接下来的几秒钟视频。这被称为面向恢复的展开训练(Recovery-oriented Rollout Training, RRT)。这就像是在教一名体操运动员,即使在第一步时踉跄了一下,也要完成一个完美的后空翻。AI 学习如何在错误发生时进行自我修复,而不是仅仅寄希望于错误不要发生。
一旦 AI 在两条赛道上都完成了训练,研究人员就会将这两种技能结合起来。他们把那个快速的跑者和那个恢复专家合并成一名超级运动员。这个全新的数字分身可以生成实时视频,同时又足够强大,能够应对长达数小时的交谈而不丢失身份或失去协调感。为了让它更快,他们引入了一个聪明的技巧,叫做 ForeverCache。通常情况下,每当 AI 生成一段新的视频块时,它都必须重新阅读它刚刚创作的整个历史,这就像是每写一个新句子都要重新读一遍整本书。ForeverCache 则像是一个智能书签;它记住了故事中稳定的部分(背景、人的面部),这样 AI 就不必每次都重新计算它们,而只需专注于当前正在编写的新内容。
结果令人印象深刻。基于一个拥有 220 亿参数的庞大视频基础模型,Avatar-Forever 在单张强大的 H100 图形卡上可以生成 768 × 512 像素的高分辨率视频,帧率达到 27.2 帧/秒。这足以支持实时交互。在测试中,该系统成功让数字分身自然地交谈了超过 11 分钟,期间没有出现面部融化、声音偏移或动作变得机械化的情况。虽然其他方法在一段时间后会表现出“身份漂移”(即看起来像变了个人)或重复、僵硬的姿态,但 Avatar-Forever 始终保持了角色的一致性和动作的流畅性。团队还创建了一个完全合成的数据集来进行训练,这意味着他们使用 AI 生成了训练视频,以确保完美的质量和对齐,避免了现实世界互联网视频的杂乱无章。
这篇论文表明,这种“分轨并行”的方法比以往那些纠缠不清的方法更能构建持久的数字人类。通过将速度的需求与稳定性的需求分离,研究人员找到了实现创建能够无限期与我们交谈、教学或娱乐的数字人的切实路径,避免了通常会破坏沉浸感的数字故障。虽然该系统目前是针对高性能服务器优化的,尚未应用于家用电脑,但它为我们的数字伴侣能够陪伴我们尽可能长的时间开启了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。