← 最新论文
💻 computer science

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

本文提出了 Hallo-Live,这是一个用于联合音视频数字人生成的实时流式框架,它通过采用具备未来扩展注意力机制和以人为中心的偏好引导 DMD 的异步双流扩散技术,实现了高速、低延迟的性能,在效率和生成质量方面均显著优于现有模型。

原作者: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要创建一个能够说话、且唇部动作与你输入的内容完美同步的数字角色(虚拟化身)。通常,制作这些角色就像尝试烘焙一个复杂的蛋糕:耗时漫长,而且如果你试图加快进程,蛋糕往往会变得扁平或歪斜。

本文介绍了一种名为Hallo-Live的新系统,它能让创建这些说话虚拟化身变得像发送短信一样迅速,同时不牺牲质量。以下是其工作原理,采用简单的类比说明:

1. 问题所在:“盲演”的演员

在以往的系统中,计算机就像一个被严格禁止在需要说话的那一刻之前查看剧本的演员。

  • 问题所在:在现实生活中,当我们说话时,嘴唇会在声音从口中发出之前就开始移动。我们会为下一个声音做准备。
  • 旧方法:由于旧的计算机模型无法“窥探”接下来的几个词,虚拟化身嘴唇的动作会滞后于声音,看起来机械且不同步。
  • 速度问题:为了让虚拟化身看起来自然,计算机通常必须为每一秒视频进行海量的数学运算。这对于实时聊天来说耗时过长。

2. 解决方案:“预读未来”的演员

Hallo-Live 通过一种名为**未来扩展注意力(Future-Expanding Attention)**的技巧解决了延迟问题。

  • 类比:想象虚拟化身是一个演员,被允许在说当前台词时,窥探剧本中的下一句
  • 工作原理:该系统赋予视频部分大脑一个微小的“前瞻”窗口。它既能看到当前的音频,也能看到即将出现的后续几个声音。这使得虚拟化身能够像人类一样,为了预判下一个声音而提前开始移动嘴唇。这让唇形同步感觉自然且即时,尽管系统仍在“实时”运行。

3. 速度提升:“蒸馏”后的学生

为了让系统快得足以即时运行,研究人员使用了一种称为**蒸馏(Distillation)**的技术。

  • 类比:将原本的高质量模型想象成一位需要 2 小时才能烹制出完美菜肴的主厨。而新模型则是一位学徒厨师
  • 问题:通常,当你教学生像主厨那样快速烹饪时,他们会因为匆忙而犯错(食物味道平淡或外观凌乱)。
  • 修正方案(以人为中心的偏好):研究人员没有仅仅告诉学生去“模仿主厨”,而是给了学生一个口味测试小组
    • 他们不只是说:“让它看起来像主厨做的一样。”
    • 他们说的是:“确保面部看起来真实(视觉保真度)”、“确保声音听起来自然(语音自然度)”以及“确保嘴唇与文字匹配(同步性)”。
    • 如果学生的烹饪在这些具体的人类偏好上得分高,他们就会获得“奖励”。如果看起来机械或不同步,得分就会降低。
    • 这教导学生在保持速度的同时,不牺牲人类最在意的要素。

成果:一个魔术

论文声称,在强大的计算机芯片(NVIDIA H200 GPU)上,新系统实现了以下效果:

  • 速度:它以每秒 20.38 帧的速度生成视频。这足以支持实时对话。
  • 延迟:启动仅需0.94 秒。这意味着等待时间不到一秒。
  • 对比:它比之前的“主厨”(Ovi 模型)快 16 倍,且延迟降低了 99 倍,同时仍能生成高质量视频,其中嘴唇动作与声音完美同步。

它能做什么

论文表明,该系统在各种场景中表现良好:

  • 逼真人物:创建人们说话时的照片级真实肖像。
  • 卡通形象:制作风格化的动画角色。
  • 群体场景:处理两人互相交谈的场景。
  • 不同角度:适用于面部特写或全身镜头。

简而言之,Hallo-Live 就像给数字演员提供了一份可以提前窥探的剧本,并配备了一套严格的口味测试员,以确保他们不会为了求快而牺牲表演质量,最终呈现出一个感觉鲜活且能即时回应的说话虚拟化身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →