← 最新论文
💻 computer science

Multi-View Face and Gesture Animation with Dynamic Gaussians

本文提出了 MVFGA,这是一种新颖的多视图流水线,它结合了对面部和手部的独立建模、参数化上半身网格以及 3D 高斯泼溅技术,旨在生成具有准确面部表情和手势的高保真、照片级真实的上半身数字人,并随之发布了 MVFGA-MoCap 数据集。

原作者: Alireza Javanmardi, Vippin Kumar Jeetmal, Christen Millerdurai, Alain Pagani, Didier Stricker

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Alireza Javanmardi, Vippin Kumar Jeetmal, Christen Millerdurai, Alain Pagani, Didier Stricker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为电子游戏或虚拟会议构建一个真实人类的数字孪生体。在计算机图形学领域,这就像是试图创造一个看起来完全像人、但能像真人一样自然地移动和说话的木偶。长期以来,科学家们一直面临着一个棘手的难题:如何让一个数字面部在展现真实情感的同时,还能让双手进行精准的挥手和指点?如果你过于关注面部,双手看起来就会像僵硬的方块;如果你专注于全身,面部往往会看起来像一张平滑且毫无表情的面具。这篇论文出自计算机动画领域,这是一个致力于教计算机如何创建动态图像的科学分支。它建立在两个主要概念之上:“参数化模型”(parametric models),它们就像灵活的数字骨架,可以被拉伸和扭曲以适应人的形状;以及“3D 高斯泼溅”(3D Gaussian Splatting),这是一种现代技术,它使用数百万个微小的、模糊的 3D 点而不是传统的扁平三角形来绘制场景。其目标是创造出不仅在照片中看起来真实,而且在运动时也感觉栩栩如生的化身,从而避免“恐怖谷”(uncanny valley)现象——即那种当你觉得某个东西看起来几乎像人,但又有些微偏差时所产生的诡异感。

这项研究背后的研究人员 Alireza Javanmardi 及其团队决定通过构建一个名为 MVFGA(具有动态高斯的多元视角面部与手势动画)的新系统来解决这个问题。把他们的方法想象成一位大厨,不再试图在一个巨大的锅里烹饪整顿饭,而是先将食材分别准备好,然后再完美地组合在一起。他们并没有尝试将整个人体建模为一个巨大的、混乱的团块,而是构建了一个特殊的“上半身”木偶。他们采用了一个标准的数字身体模型,并进行了“外科手术式”的处理,去掉了腿部,只保留了躯干、头部和手臂。接着,他们做了一件聪明的事:在这个木偶上安装了两个专门的“控制面板”。一个面板完全致力于面部(使用名为 FLAME 的系统),另一个则完全致力于手部(使用名为 MANO 的系统)。这使得计算机可以独立地调整面部表情和手指动作,确保微笑不会意外扭曲手指,而挥手也不会导致眼睛变形。

有了这个灵活的骨架后,他们并没有止步于线框模型。他们在木偶表面覆盖了一层“3D 高斯”。想象一下,拿起一把微小的、发光的、模糊的云朵,并将它们全部粘在木偶的表面。这些云朵不仅仅是装饰;它们承载着人的皮肤、头发和衣服的颜色与纹理。当木偶移动时,这些云朵会随着它一起拉伸和挤压,从而创造出一个超现实的、高清晰度的图像,看起来更像是照片而非卡通。为了教导计算机如何做到这一点,团队并没有只使用单个摄像机。他们在主体周围布置了一个由 17 个摄像机组成的环形工作室。他们拍摄了 15 个人进行各种动作的视频,从做滑稽的面部表情到进行复杂的手势以及自由流动的交谈。这创建了一个庞大的数据集,他们将其命名为 MVFGA-MoCap,作为训练场,让计算机能够学习光影在移动的人体上从各个角度是如何表现的。

实验结果令人印象深刻。当他们将新系统与其他顶尖方法进行对比测试时,MVFGA 始终能产生更清晰、更真实的图像。例如,在衡量计算机生成图像与真实照片的接近程度时,他们的方法误差率(L1)仅为 4.06,远低于排名第二的方法(其误差为 9.59)。在视觉相似度(SSIM)方面,他们的得分达到了 0.938,击败了竞争对手。但真正的魔力在于细节。虽然其他方法经常将手部变成模糊的色块,或者在手指交叉时丢失特定的形状,但 MVFGA 保持了手指的清晰与准确。他们还发现,他们的化身可以通过一段简单的真人说话视频来驱动,系统会忠实地还原出数字孪生的面部表情和手势,即使是从摄像机从未真正捕捉过的角度观察。

然而,作者也谨慎地指出,这并不是解决一切问题的万能药。他们的系统仍然依赖于那个底层的“骨架”模型,这意味着它无法轻松处理诸如衣服随风剧烈飘动或帽子掉落之类的情况,因为这些属于模型并未明确追踪的“次级运动”。此外,由于他们主要针对前向视角进行训练,如果尝试从背面观察化身,系统会表现得有些吃力,因为数据集没有捕捉到足够背面的信息。尽管存在这些局限性,论文表明,通过分离面部与手部,并用一层 3D 点云包裹它们,他们找到了一种让数字人类更接近真实感的方法,为更具沉浸感的虚拟现实体验和更好的数字通信工具铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →