Instant Expressive Gaussian Head Avatars at Over 100 FPS
本文提出了一种前馈流水线,通过采用高效的局部融合策略和解耦运动学习,将单张图像即时转换为具有 3D 一致性、高表现力且可实时驱动的 Gaussian 头部数字人,从而解决了现有方法中存在的速度、一致性与细节之间的权衡难题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想要创建一个人的数字孪生——一个 3D 版的脸部模型,你可以让它实时说话、微笑和转动头部。长期以来,计算机科学家们一直困于一个“三难困境”(trilemma),即在三个维度之间进行拉锯战,通常你只能三选二:
- 速度(Speed): 它运行得够快吗,能用于视频通话?
- 3D 一致性(3D Consistency): 如果这个人转动头部,脸部看起来是一个实体的 3D 物体,还是会像劣质游戏那样发生扭曲和闪烁?
- 表现力(Expressiveness): 它能否捕捉到细微的细节,比如鼻纹、眼角的皱纹以及微妙的嘴部动作?
大多数方法要么很快但看起来很扁平、很假(2D 方法);要么看起来是 3D 且真实,但太慢了,无法用于直播(3D 方法)。
这篇论文介绍了一种全新的解决方案,名为 Instant Expressive Gaussian Head Avatars(即时表现力高斯头部头像)。你可以把它想象成一个“神奇的翻译器”,能瞬间将一张人的照片变成一个充满生机的 3D 木偶,并能由另一个视频来控制。
以下是它的工作原理,使用了日常类比:
1. 基础构建块:3D “喷漆”
作者并没有使用实心的网格(像黏土雕塑)或复杂的各种光影云团(像雾气弥漫的房间)来构建脸部,而是使用了 3D 高斯(3D Gaussians)。
- 类比: 想象将一张高分辨率照片变成数百万个漂浮在 3D 空间中的微小、有颜色、半透明的“喷漆点”。
- 为什么有效: 这些点渲染起来非常快(在屏幕上绘制)。你可以绕着它们移动摄像机,它们看起来立刻就像一个实体的 3D 物体。这解决了速度和 3D 一致性的问题。
2. 核心秘诀:在另一个维度移动“肌肉”
最棘手的部分是如何让这些点移动以模仿微笑或皱眉。
- 旧方法: 以前的方法试图在物理空间中推动这些点。这就像用手指去雕刻湿黏的黏土;速度很慢,而且往往会错过像皱纹形成这样细微的细节。
- 新方法: 作者意识到,与其在物理空间中移动这些点,不如改变点内部的“信息”。
- 类比: 想象每个喷漆点内部都有一本微小的“说明书”(特征向量)。系统不是通过移动点来操作,而是重写说明书里的指令。
- 为了实现微笑,系统不是向上推这些点,而是改变嘴部周围点的“颜色和形状”指令。
- 这发生在“高维特征空间”(一个高级的数学世界)中,这使得系统能够实现更细腻、更丰富的运动,比如捕捉皮肤褶皱或皱纹的方式,而不会降低速度。
3. 训练过程:向“超级老师”学习
为了教这个系统如何运动,他们需要大量的数据。真实的视频很难使用,因为摄像机角度的变化会干扰 3D 模型。
- 策略: 他们使用了一个强大的 AI(扩散模型)来生成数千张完美的、正对着镜头的、带有极端表情的人脸照片。
- 类比: 把这想象成一个学生学习绘画的过程。与其尝试在拥挤的房间里从奇怪的角度素描一个人,这位“老师”(扩散模型)会给学生一张完美的、正对着镜头的、正在做搞怪表情的照片。学生通过这张完美的照片学习“运动”。
- 安全网: 为了确保 AI 不会开始产生幻觉(比如在不该长胡须的地方长出胡须),他们只允许“老师”在脸部正面进行绘制。然后,他们使用另一个工具来确定侧视图应该是什么样子,从而确保 3D 物体保持一致性。
4. 结果:即时且富有表现力
最终的系统运作如下:
- 输入: 你给它一张人的照片(“源图像”)。
- 即时转换: 它瞬间将那张照片转化为 3D “喷漆”头像。这大约需要 20 毫秒。
- 动画驱动: 你给它一段别人说话的视频(“驱动视频”)。系统读取驱动者的表情,并立即更新“源图像”头像内点的“说明书”。
- 输出: 你得到一段“源图像”中的人表演“驱动视频”表情的视频,且你可以从任何角度观看。
性能表现:
- 速度: 它的运行速度超过 100 帧每秒 (FPS)。这足以支持流畅、无延迟的视频通话。
- 质量: 它能捕捉到其他快速方法会错过的细节,如鼻纹和眼部运动。
- 一致性: 如果头像转头,脸部会保持稳固,不会出现闪烁或扭曲。
简而言之,作者构建了一个像实时 3D 木偶师一样的系统。它获取一张照片,将其转化为由数百万个智能微点组成的 3D 角色,并能以电子游戏的响应速度和高品质电影级的细节,通过视频来控制这个角色的面部表情,且无需耗费数小时的计算机处理时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。