Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
本文介绍了 Live Avatar,这是一个协同设计的算法-系统框架,它通过将蒸馏后的因果扩散流水线与时间步强制流水线并行技术(Timestep-forcing Pipeline Parallelism)相结合,实现了首个实用的、实时且无限长度的 140 亿参数音频驱动化身生成,在达到 45 FPS 的同时消除了长时程身份漂移问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人讲故事。你希望它能说话、动嘴、并根据你的声音完美同步地改变面部表情,同时看起来像一个真人。这就是**音频驱动数字人生成(audio-driven avatar generation)的世界。长期以来,科学家们一直在利用一种叫做扩散模型(diffusion model)**的 AI 技术来构建“数字演员”。你可以把扩散模型想象成一位雕塑家,他从一块充满噪声的静态块开始,通过一点点剔除噪声,最终显现出一尊完美的雕像。通常,这位雕塑家工作得非常严格:他必须先完成头部,然后才能开始制作身体,而且必须按部就班地进行,这需要很长时间。
一个大问题是,如果你要求这个机器人讲一个小时的故事,它往往会变得混乱。它可能会忘记角色五分钟前长什么样,或者它的声音听起来可能完全变成了另一个人。这被称为“漂移(drift)”。此外,由于雕塑家的工作速度很慢,你无法与它进行实时对话;等你一句话说完,它才刚完成,而你早已忘记了刚才说了什么。研究人员的目标一直是构建一个既能实时与你交谈,又足够聪明能保持数小时身份一致性,且细节足够逼近照片级真实感的数字演员。
于是有了 Live Avatar,这是一个像指挥家一样指挥着庞大计算机芯片管弦乐团的新项目。由中国科学技术大学和阿里巴巴团队领导的研究人员发现,他们可以让一个拥有 140 亿参数(在 AI 领域这是一个巨大的规模,即“14B”模型)的巨型 AI 模型在不“发疯”的情况下进行说话、动作和视频流传输。
通常情况下,制作如此长且如此快速的视频是一个矛盾。你可以选择速度,或者选择质量,但两者不可兼得。Live Avatar 通过改变 AI 对“时间”和“记忆”的思考方式解决了这个问题。系统不再试图记住过去每一个完美的细节(这会导致 AI 产生混乱和漂移),而是存储一种“带有噪声的”记忆。想象一下,尝试通过哼唱旋律的大致轮廓来回忆一首歌,而不是试图精准回忆每一个音符。这种“粗略”的记忆就像一个过滤器,在让嘴部自然运动的同时,保持角色面部的稳定。
该团队还发明了一种被称为**时间步强制并行流水线(Timestep-forcing Pipeline Parallelism)**的巧妙加速方法。想象一个工厂的装配线,与其让一名工人完成造车的每一个步骤,不如让一个团队分工协作。在普通的视频 AI 中,每个工人都要等待前一个人完成后才能开始。Live Avatar 改变了规则:流水线上的每个工人(或每个计算芯片,即 GPU)都被分配了一个特定的步骤。当工人 A 正在抛光车轮时,工人 B 正在喷漆车门,而工人 C 正在安装引擎,所有这些都在同一时间进行。这把一个缓慢的顺序过程变成了一个快速的并行过程。
结果令人印象深刻。在配备了 5 张强大的 H100 显卡的设置下,Live Avatar 可以以 **45 帧每秒(FPS)**的速度生成视频,这比人类视觉的速度还要快。在你说话后,它仅需 1.21 秒即可开始生成第一帧。最重要的是,它可以永远持续下去。研究人员通过让数字人连续说话超过 10,000 秒(接近三小时)进行了测试,角色没有发生漂移,没有出现闪烁,也没有丢失其身份特征。
这不仅仅是一个理论上的胜利;团队还建立了一个新的测试场 GenBench,以证明其他方法在长时长表现上的失败,以及他们方法的成功。他们发现,虽然其他系统在几秒钟内看起来不错,但在几分钟后就会开始退化、变色或丢失人的面部特征。然而,Live Avatar 却能保持一致性。这表明,通过结合“噪声记忆”策略和智能的“装配线”系统,我们终于可以拥有准备好进行无限实时对话的数字人。
论文明确排除了“需要用数小时的视频来训练 AI 以使其能够工作数小时”的观点。相反,他们展示了只要使用特殊的“噪声历史”技巧,使用短片段(约 3 秒)进行训练就足够了。他们也反驳了旧有的观念,即必须在快速低质模型和缓慢高质量模型之间做出选择。通过他们的方法,你可以拥有一个庞大且高质量且能实时运行的模型。
尽管该系统速度极快,但作者指出仍存在微小的延迟。包括网络传输时间在内,从你说话到视频出现在屏幕上的时间大约为 3 秒。这对于许多交互场景来说已经足够快,但对于追求毫秒必争的无缝面对面交谈可能还不够。然而,对于流媒体、虚拟助手和数字叙事而言,这是一个巨大的飞跃,预示着无限实时数字人的时代已不再仅仅是一个梦想。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。