CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation
本文介绍了 CETalk,这是一个音频驱动的 3D 会话头部生成框架,它利用连续的效价-唤醒度(Valence-Arousal)表示和多尺度时间建模架构,在克服离散情感类别局限性的同时,实现了细粒度的情感控制和准确的唇形同步。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的数字媒体世界中,创造逼真虚拟人的能力已从科幻领域的构想转变为实际应用。这些数字分身越来越多地被用于虚拟助手、虚拟现实通信以及互动娱乐领域。该领域的一个核心挑战是让这些角色用脸部进行交流,而不仅仅是动嘴。早期的系统虽然可以成功地将唇动与 spoken 言语匹配,但往往难以传达出使人类对话显得真实的那些微妙且不断变化的表情。传统方法将情绪视为不同的、独立的类别,例如“快乐”、“悲伤”或“愤怒”。这种方法对于宏观层面的表达有效,却无法捕捉到人类情感的流动性和连续性——例如,一个微笑可能会慢慢消退为忧虑的神情,或者兴奋感可能会在爆发之前静静地酝酿。此外,说话的时机与情绪的时机在本质上是不同的:嘴部必须快速运动以匹配单词的快速发音,而情绪表达则往往在整个脸部上更缓慢地演变。
合肥工业大学的研究人员开发了一种名为 CETalk 的新系统来解决这些特定问题。该系统没有将情绪强行归入僵化的类别,而是使用一个连续的二维图谱来描述感受,追踪一种情感是积极还是消极,以及它是活跃还是被动的。这种方法使计算机能够生成平滑变化的脸部动画,镜像人类对话中自然的起伏变化。团队构建了一个大型的新数据集来训练他们的系统,通过现有的视频录像重建了 3D 脸部动作,并自动估算了每一帧的这些连续情绪值。这些数据为教计算机区分言语所需的快速、精确运动与传达情绪的缓慢、大幅度变化提供了必要的基石。
该新系统的核心在于它如何处理时间。研究人员意识到,言语和情绪运行在不同的速度上,就像鼓手保持着稳定、快速的节奏,而歌手则拉着一个长而慢的音符一样。为了管理这一点,该系统将处理过程分为两条并行路径。一条路径专注于嘴部和下颚的高速细节,确保每一个音节都与音频完美同步。另一条路径则专注于表达情绪的较慢、较宽泛的脸部动作,例如紧锁的眉头或睁大的眼睛。随后,这两股信息流由一个智能集成系统重新汇合,该系统会逐时逐刻地决定在言语运动与情绪表达之间给予多少权重。这使得最终的动画既能实现准确的唇形同步,又具备丰富的表情深度。
为了测试他们的工作,团队使用三组不同的视频数据将他们的系统与几种现有方法进行了对比。结果显示,他们的方案比以往最好的方法产生了更准确的唇部运动和更真实的脸部表情。在 MEAD 数据集的测试中,他们的系统将唇部运动误差降低到了约 7.48 毫米,并将整体脸部运动误差降低到了约 9.91 毫米,在这一特定基准测试中超越了所有其他测试的技术。除了准确性之外,该系统还展示了遵循连续情绪指令的卓越能力。当被要求生成一个从负面状态逐渐转向正面状态的脸部时,该系统能够高精度地遵循该路径,比其竞争对手更好地匹配了预期的情绪轨迹。
研究人员还展示了该系统允许对情绪强度进行细粒度的控制。通过调整输入值,他们可以让角色的表情微妙地变得更强烈或更内敛,而不会破坏与声音的同步。这种控制水平对于创造真正具有生命力的数字人至关重要,使其能够实现定义真实人类互动的细微且连续的情绪转变。通过摒弃离散的类别并拥抱人类情感的连续性,这项工作为使虚拟通信感觉不再像是观察机器,而更像是与人建立连接,迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。