← 最新论文
💻 computer science

Instant Expressive Gaussian Head Avatars at Over 100 FPS

本文提出了一种前馈流水线,通过采用高效的局部融合策略和解耦运动学习,将单张图像即时转换为具有 3D 一致性、高表现力且可实时驱动的 Gaussian 头部数字人,从而解决了现有方法中存在的速度、一致性与细节之间的权衡难题。

原作者: Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要创建一个人的数字孪生——一个 3D 版的脸部模型,你可以让它实时说话、微笑和转动头部。长期以来,计算机科学家们一直困于一个“三难困境”(trilemma),即在三个维度之间进行拉锯战,通常你只能三选二:

  1. 速度(Speed): 它运行得够快吗,能用于视频通话?
  2. 3D 一致性(3D Consistency): 如果这个人转动头部,脸部看起来是一个实体的 3D 物体,还是会像劣质游戏那样发生扭曲和闪烁?
  3. 表现力(Expressiveness): 它能否捕捉到细微的细节,比如鼻纹、眼角的皱纹以及微妙的嘴部动作?

大多数方法要么很快但看起来很扁平、很假(2D 方法);要么看起来是 3D 且真实,但太慢了,无法用于直播(3D 方法)。

这篇论文介绍了一种全新的解决方案,名为 Instant Expressive Gaussian Head Avatars(即时表现力高斯头部头像)。你可以把它想象成一个“神奇的翻译器”,能瞬间将一张人的照片变成一个充满生机的 3D 木偶,并能由另一个视频来控制。

以下是它的工作原理,使用了日常类比:

1. 基础构建块:3D “喷漆”

作者并没有使用实心的网格(像黏土雕塑)或复杂的各种光影云团(像雾气弥漫的房间)来构建脸部,而是使用了 3D 高斯(3D Gaussians)

  • 类比: 想象将一张高分辨率照片变成数百万个漂浮在 3D 空间中的微小、有颜色、半透明的“喷漆点”。
  • 为什么有效: 这些点渲染起来非常快(在屏幕上绘制)。你可以绕着它们移动摄像机,它们看起来立刻就像一个实体的 3D 物体。这解决了速度3D 一致性的问题。

2. 核心秘诀:在另一个维度移动“肌肉”

最棘手的部分是如何让这些点移动以模仿微笑或皱眉。

  • 旧方法: 以前的方法试图在物理空间中推动这些点。这就像用手指去雕刻湿黏的黏土;速度很慢,而且往往会错过像皱纹形成这样细微的细节。
  • 新方法: 作者意识到,与其在物理空间中移动这些点,不如改变点内部的“信息”。
  • 类比: 想象每个喷漆点内部都有一本微小的“说明书”(特征向量)。系统不是通过移动点来操作,而是重写说明书里的指令。
    • 为了实现微笑,系统不是向上推这些点,而是改变嘴部周围点的“颜色和形状”指令。
    • 这发生在“高维特征空间”(一个高级的数学世界)中,这使得系统能够实现更细腻、更丰富的运动,比如捕捉皮肤褶皱或皱纹的方式,而不会降低速度。

3. 训练过程:向“超级老师”学习

为了教这个系统如何运动,他们需要大量的数据。真实的视频很难使用,因为摄像机角度的变化会干扰 3D 模型。

  • 策略: 他们使用了一个强大的 AI(扩散模型)来生成数千张完美的、正对着镜头的、带有极端表情的人脸照片。
  • 类比: 把这想象成一个学生学习绘画的过程。与其尝试在拥挤的房间里从奇怪的角度素描一个人,这位“老师”(扩散模型)会给学生一张完美的、正对着镜头的、正在做搞怪表情的照片。学生通过这张完美的照片学习“运动”。
  • 安全网: 为了确保 AI 不会开始产生幻觉(比如在不该长胡须的地方长出胡须),他们只允许“老师”在脸部正面进行绘制。然后,他们使用另一个工具来确定侧视图应该是什么样子,从而确保 3D 物体保持一致性。

4. 结果:即时且富有表现力

最终的系统运作如下:

  1. 输入: 你给它一张人的照片(“源图像”)。
  2. 即时转换: 它瞬间将那张照片转化为 3D “喷漆”头像。这大约需要 20 毫秒。
  3. 动画驱动: 你给它一段别人说话的视频(“驱动视频”)。系统读取驱动者的表情,并立即更新“源图像”头像内点的“说明书”。
  4. 输出: 你得到一段“源图像”中的人表演“驱动视频”表情的视频,且你可以从任何角度观看。

性能表现:

  • 速度: 它的运行速度超过 100 帧每秒 (FPS)。这足以支持流畅、无延迟的视频通话。
  • 质量: 它能捕捉到其他快速方法会错过的细节,如鼻纹和眼部运动。
  • 一致性: 如果头像转头,脸部会保持稳固,不会出现闪烁或扭曲。

简而言之,作者构建了一个像实时 3D 木偶师一样的系统。它获取一张照片,将其转化为由数百万个智能微点组成的 3D 角色,并能以电子游戏的响应速度和高品质电影级的细节,通过视频来控制这个角色的面部表情,且无需耗费数小时的计算机处理时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →