DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation
本文介绍了 DynaForcing,这是一个通过结合混合强制(hybrid forcing)、动力学感知奖励正则化(dynamics-aware reward regularization)以及参考扰动(reference perturbation),在显著降低计算成本的同时,同步恢复时序运动并提升视觉质量,从而解决流式化身生成中自强制蒸馏(self-forcing distillation)存在“动态崩溃”问题的训练框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,创造一个能够实时说话和运动的数字人是其中最宏伟的目标之一。这项技术依赖于一种过程,即计算机学习模仿一个“教师模型”——一个经过数千小时视频训练的庞大系统,从而产生一个更小、更快且能够进行直播的版本。这个较小的模型旨在生成一个能与语音节奏相匹配的谈话头像,使嘴唇和面部肌肉能够以自然的精度运动。多年来,研究人员一直被一个令人沮丧的悖论所困扰:随着他们使这些数字分身变得更快、更高效,它们往往变得异常静止。这些脸部看起来清晰且逼真,却失去了运动的能力,冻结成了一个静态的面具,无法匹配其本应发出的声音。这种运动的丧失——即数字角色停止了呼吸和眨眼——一直是创造真正具有交互性的虚拟伴侣的持久障碍。
一组研究人员现在已经准确识别了发生这种情况的原因,并构建了一个新系统来解决它。他们发现,正是用于让这些分身变快的这种方法本身,也是导致其静止的原因。这种训练过程要求计算机从其之前的输出中学习以加速生成,这创造了一个反馈循环。如果计算机生成的某一帧中,嘴巴张开的角度比应该有的稍小,它就会利用这一略微错误的帧来预测下一帧。由于系统试图匹配一张静态的人脸图像,它发现保持嘴巴闭合比去理解言语所需的复杂、快速的运动要容易得多。随着时间的推移,这种微小的误差不断累积,导致模型坍缩到近乎零运动的状态,产生出高质量但从不移动的图像。研究人员发现,这并非视频质量本身的问题,而是模型学习如何处理时间和变化时的一个根本性失败。
为了解决这个问题,研究人员开发了一种名为 DynaForcing 的新训练框架,它在学习过程的三个不同阶段起到了纠正作用。首先,他们改变了训练的起点。他们不再让计算机从纯粹的随机性中猜测视频序列的开始,而是偶尔向其输入一段真实视频的轻微模糊版本。这提供了一个坚实的锚点,提醒模型真实的运动看起来是什么样的,并防止其漂移到静态状态。其次,他们增加了一个特定的奖励系统。就像学生可能会因为额外的工作而获得一颗小星星一样,每当计算机生成具有准确唇动和自然面部表情的视频时,就会得到一个数字奖励。这种奖励就像一个向导,推动模型远离“保持静止”这条容易的路,走向“正确运动”这条更难的路。最后,他们修改了计算机用于引导的参考图像。在标准训练中,计算机经常过度复制参考照片的背景和姿态,从而忽略了声音。研究人员修改了这些照片,在保持人脸不变的同时改变了背景和光照。这迫使计算机停止复制静态细节,转而完全依赖音频来生成必要的运动。
这种方法的结果是立竿见影且意义重大的。在对约十秒钟的短视频和超过五分钟的长视频进行测试时,新系统生成的数字分身展现出了与原始庞大教师模型相当的自然度。数字脸部不再冻结;它们能与单词同步张合嘴巴,表情也会随语调自然变化。研究人员使用唇形同步和表情多样性的特定评分来衡量这种进步,发现他们的方法恢复了以往快速系统所丢失的动态运动。例如,衡量面部运动多样性的指标从极低的分数跃升至高分,达到了顶级非实时模型的水平。至关重要的是,该系统保持了其速度,能够以每秒 45 帧的速度生成视频,这足以满足实时交互的需求。
除了修复运动问题外,研究人员还使训练过程本身变得更加高效。旧方法需要大量的计算机内存来追踪视频生成的每一个步骤,通常需要数百块强大的显卡来训练单个模型。通过重新组织计算机处理这些步骤的方式并丢弃不必要的数据,新方法将硬件需求降低了十倍以上。这意味着,创建这些高质量、动态变化的数字分身现在对更多的研究人员和开发者来说都是可行的,而不仅仅是那些拥有超级计算机的人。这项工作证明了同时拥有速度和运动是可能的,解决了长期以来似乎无法避免的权衡问题。该系统生成的数字分身不再是冻结的雕像;它们是动态的、有响应能力的,并且准备好开口说话了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。