✨ 要点🔬 技术摘要
想象一下,你正试图为电子游戏或虚拟会议构建一个真实人类的数字孪生体。在计算机图形学领域,这就像是试图创造一个看起来完全像人、但能像真人一样自然地移动和说话的木偶。长期以来,科学家们一直面临着一个棘手的难题:如何让一个数字面部在展现真实情感的同时,还能让双手进行精准的挥手和指点?如果你过于关注面部,双手看起来就会像僵硬的方块;如果你专注于全身,面部往往会看起来像一张平滑且毫无表情的面具。这篇论文出自计算机动画领域,这是一个致力于教计算机如何创建动态图像的科学分支。它建立在两个主要概念之上:“参数化模型”(parametric models),它们就像灵活的数字骨架,可以被拉伸和扭曲以适应人的形状;以及“3D 高斯泼溅”(3D Gaussian Splatting),这是一种现代技术,它使用数百万个微小的、模糊的 3D 点而不是传统的扁平三角形来绘制场景。其目标是创造出不仅在照片中看起来真实,而且在运动时也感觉栩栩如生的化身,从而避免“恐怖谷”(uncanny valley)现象——即那种当你觉得某个东西看起来几乎像人,但又有些微偏差时所产生的诡异感。
这项研究背后的研究人员 Alireza Javanmardi 及其团队决定通过构建一个名为 MVFGA (具有动态高斯的多元视角面部与手势动画)的新系统来解决这个问题。把他们的方法想象成一位大厨,不再试图在一个巨大的锅里烹饪整顿饭,而是先将食材分别准备好,然后再完美地组合在一起。他们并没有尝试将整个人体建模为一个巨大的、混乱的团块,而是构建了一个特殊的“上半身”木偶。他们采用了一个标准的数字身体模型,并进行了“外科手术式”的处理,去掉了腿部,只保留了躯干、头部和手臂。接着,他们做了一件聪明的事:在这个木偶上安装了两个专门的“控制面板”。一个面板完全致力于面部(使用名为 FLAME 的系统),另一个则完全致力于手部(使用名为 MANO 的系统)。这使得计算机可以独立地调整面部表情和手指动作,确保微笑不会意外扭曲手指,而挥手也不会导致眼睛变形。
有了这个灵活的骨架后,他们并没有止步于线框模型。他们在木偶表面覆盖了一层“3D 高斯”。想象一下,拿起一把微小的、发光的、模糊的云朵,并将它们全部粘在木偶的表面。这些云朵不仅仅是装饰;它们承载着人的皮肤、头发和衣服的颜色与纹理。当木偶移动时,这些云朵会随着它一起拉伸和挤压,从而创造出一个超现实的、高清晰度的图像,看起来更像是照片而非卡通。为了教导计算机如何做到这一点,团队并没有只使用单个摄像机。他们在主体周围布置了一个由 17 个摄像机 组成的环形工作室。他们拍摄了 15 个人 进行各种动作的视频,从做滑稽的面部表情到进行复杂的手势以及自由流动的交谈。这创建了一个庞大的数据集,他们将其命名为 MVFGA-MoCap ,作为训练场,让计算机能够学习光影在移动的人体上从各个角度是如何表现的。
实验结果令人印象深刻。当他们将新系统与其他顶尖方法进行对比测试时,MVFGA 始终能产生更清晰、更真实的图像。例如,在衡量计算机生成图像与真实照片的接近程度时,他们的方法误差率(L1)仅为 4.06 ,远低于排名第二的方法(其误差为 9.59 )。在视觉相似度(SSIM)方面,他们的得分达到了 0.938 ,击败了竞争对手。但真正的魔力在于细节。虽然其他方法经常将手部变成模糊的色块,或者在手指交叉时丢失特定的形状,但 MVFGA 保持了手指的清晰与准确。他们还发现,他们的化身可以通过一段简单的真人说话视频来驱动,系统会忠实地还原出数字孪生的面部表情和手势,即使是从摄像机从未真正捕捉过的角度观察。
然而,作者也谨慎地指出,这并不是解决一切问题的万能药。他们的系统仍然依赖于那个底层的“骨架”模型,这意味着它无法轻松处理诸如衣服随风剧烈飘动或帽子掉落之类的情况,因为这些属于模型并未明确追踪的“次级运动”。此外,由于他们主要针对前向视角进行训练,如果尝试从背面观察化身,系统会表现得有些吃力,因为数据集没有捕捉到足够背面的信息。尽管存在这些局限性,论文表明,通过分离面部与手部,并用一层 3D 点云包裹它们,他们找到了一种让数字人类更接近真实感的方法,为更具沉浸感的虚拟现实体验和更好的数字通信工具铺平了道路。
技术摘要:基于动态高斯的多视角面部与手势动画 (MVFGA)
问题陈述
创建具有真实上半身运动的写实 3D 数字人头像仍然是计算机图形学领域的一个重大挑战。现有方法通常面临一种权衡:专注于头部的方法往往忽略了手势;而全身重建方法则经常无法保持精细的面部保真度和准确的手部姿态。因此,当前的技术难以捕捉对于自然人类交流至关重要的面部表情和手势的细微动态。此外,虽然全身参数化模型能够通过单目或多视角输入进行重建,但它们往往缺乏进行详细面部动画和手部关节运动所需的精度。生成式方法虽然前景广阔,但在多视角一致性、视角依赖性伪影以及对未见区域的幻觉生成方面仍面临困难。
方法论
作者提出了 MVFGA (基于动态高斯的多元视角面部与手势动画),这是一个旨在生成逼真上半身数字人的多视角一致性流水线。该方法将显式参数化建模与 3D 高斯泼溅(3DGS)相结合,以实现高保真渲染与动画。
1. 上半身网格重建
该流水线首先从通过校准相机阵列(17 个摄像头)捕获的时间对齐多视角 RGB 视频中,重建详细的 3D 上半身网格。
关键点提取与分割: 系统提取 2D 全身关键点,执行身体部位分割,并应用背景抠图以隔离演员。
专门的参数估计: 为了捕捉表现力强的运动,该方法会对整体拟合精度较低的区域进行优化。它使用基于优化的追踪器来获取面部参数(MICA/FLAME),以及使用基于 Transformer 的估计器来获取手部参数(HaMeR/MANO)。
多视角一致性: 由于标准追踪器是针对单目输入优化的,系统会生成多个候选估计值,并选择聚合多视角 2D 重投影误差最低的一个,以确保视角一致性。
统一参数化模型: 作者定义了一种新型上半身参数化模型,它是 SMPL-X 的扩展,在保留形状、姿态和表情参数的同时,将网格拓扑限制在上半身。该模型通过针对多视角 2D 关键点及相机内参/外参联合优化身体、面部和手部参数来拟合演员。
2. 3D 高斯泼溅动画
一旦获得可变形网格,系统便会利用 3D 高斯进行增强,以合成写实动态数字人。
初始化: 遵循 GaussianAvatar 的策略,每个处于姿态下的网格三角形都由一个位于其中心位置的单个 3D 高斯进行初始化。这些高斯参数化在所属三角形的局部坐标系中。
变换: 在渲染期间,局部高斯参数(均值、旋转、缩放)根据网格三角形的全局旋转、平移和缩放被变换到全局坐标系中。
自适应密度控制: 为了捕捉网格几何体未明确建模的高频外观细节,一种自适应密度控制机制会根据视空间位置梯度和不透明度统计数据,动态地添加或移除高斯点(splats)。至关重要的是,新创建的高斯点会继承原始父三角形的索引,以确保它们仍附着在网格表面。剪枝操作会移除低不透明度的高斯点,并包含一项约束,即每个网格三角形至少保留一个高斯点,以避免在遮挡区域出现伪影。
优化: 高斯通过可微的分块渲染器进行优化。目标函数结合了 RGB 重建损失(L1、可微 SSIM 和 LPIPS)以及针对位置和缩放的正则化项,以确保高斯点靠近其父三角形且不会变得过大。
3. 数据集:MVFGA-MoCap
为了支持训练和评估,作者引入了 MVFGA-MoCap ,这是一个全面的多视角上半身动作捕捉数据集。其特点包括:
15 名受试者(8 男 7 女)进行多样化的面部表情和双手手势表演。
通过 17 个校准好的摄像头(15 个前置,2 个后置)同步采集的视频,分辨率为 1920×1080,帧率为 25 FPS。
场景涵盖了受控表情、多样化手势以及自由形式的交流。
核心贡献
可驱动上半身参数化模型: 一种新型表示方法,将面部(FLAME)和手部(MANO)参数化分别集成到一个统一的上半身网格模型中,实现了精细的面部与手部运动。
多视角流水线: 一个用于重建上半身运动与外观的框架,通过 3-D 高斯泼溅实现写实合成与新视角渲染。
MVFGA-MoCap 数据集: 一个同步、经过校准的多视角数据集,专为上半身面部与手势动画设计,并包含拟合后的参数化模型。
实验结果
作者在三个设置下对 MVFGA 进行了评估:自我重演(self-reenactment)、新视角合成以及跨身份动画。
定量性能: MVFGA 在所有指标上均优于最先进的基准方法(包括生成式方法如 AnimateAnyone、MagicAnimate、Champ 以及基于图形学的 GUAVA)。
图像质量: 取得了最佳的 LPIPS (0.053)、PSNR (25.93)、SSIM (0.938) 和最低的 L1 误差 (4.06)。
姿态准确度: 在手部 (0.71) 和躯干 (1.37) 方面取得了最低的平均关键点距离 (AKD),并在面部 (0.18) 方面保持了竞争力。
身份保持: 达到了最高的余弦相似度 (CSIM) 分数 0.85。
时间一致性: 与基于扩散的方法相比,展现出更低的瞬时抖动误差 (TJE),在长序列中保持了稳定的动态。
定性观察: 视觉对比显示,MVFGA 能更好地保留手指结构、手部姿态准确度以及面部身份细节,特别是在涉及自我遮挡和精细交互的复杂场景中,其他方法往往会产生扭曲的配置或背景伪影。
消融实验: 实验证实,显式集成 FLAME 和 MANO、在高斯优化期间进行上半身参数的联合微调,以及引入 LPIPS 损失,对于实现高保真重建至关重要。
重要性与主张
本文声称 MVFGA 通过实现具有表现力面部动态和关节化手势的多视角一致性上半身重演,弥补了以面部为中心的方法与全身方法之间的鸿沟。通过将参数化网格(用于结构一致性)与 3D 高斯(用于高保真外观)相结合,该方法解决了现有方法要么缺乏精细细节,要么存在视角依赖性伪影的问题。
作者将这项工作定位为创建可靠、高质量数字人的重要一步,适用于虚拟现实、远程通信和内容创作等现实应用场景,在这些场景中,细微的面部表情和精确的手势至关重要。他们强调,与纯生成式方法相比,所提出的框架提供了更好的可控性和效率,同时保持了避免进入“恐怖谷”所需的视觉保真度。MVFGA-MoCap 数据集的引入被视为支持未来上半身数字人重建与动画研究的资源。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。