← 最新论文
🤖 machine learning

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

本文介绍了“Avatar Forcing”,这是一个实时交互式头部化身框架,该框架利用扩散强制(diffusion forcing)和无标签直接偏好优化(label-free direct preference optimization),针对多模态用户输入生成低延迟、具有表现力且情感参与度高的化身反应。

原作者: Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在与一位数字朋友进行视频通话。通常情况下,这些数字朋友感觉有些机械化:他们会等待你停止说话,然后给出一个预设好的答案。他们并不会在你说完话的过程中真正地“倾听”,也不会对你的微笑或点头做出即时反应。这感觉就像是一条单行道。

论文 "Avatar Forcing" 介绍了一种让这些数字朋友感觉更像真实对话伙伴的新方法。以下是其工作原理的拆解,通过简单的概念进行说明:

1. 问题所在:“等看式”机器人

目前的数字虚拟形象(Avatar)就像是一个必须等老师讲完整个讲座后才能举手的学生。它们需要看到整个对话(或者至少是几秒钟的对话)之后,才能决定如何移动头部或改变表情。这会导致延迟,使对话显得僵硬且不自然。

此外,当这些虚拟形象在“倾听”时,它们往往只是像雕像一样坐着。它们不知道如何点头、微笑回应或表现出感兴趣的样子,因为它们所训练的数据并没有展示出足够生动、自然的倾听示例。

2. 解决方案:“Avatar Forcing”

作者创建了一个名为 Avatar Forcing 的系统。可以把这理解为教会虚拟形象成为一名“现场”对话者,而不是一名“录制”的对话者。

  • “即时反应”引擎:
    与其等待整个对话结束,虚拟形象使用了一种叫做 Diffusion Forcing 的技术。想象一位画家,他一次只画一小笔,只观察自己已经画出的部分以及用户现在正在做的事情。他不会去观察未来。这使得虚拟形象能够实时做出反应(大约半秒钟的延迟),让对话感觉即时且流畅。

    • 类比: 这就像是在玩接球游戏,你扔出球,虚拟形象立即接住并扔回给你,而不是等你扔完十个球才开始。
  • “双面镜”:
    虚拟形象不仅听你的声音,还会观察你的脸部和肢体动作。如果你微笑,虚拟形象也会微笑;如果你点头,它也会点头。它使用了一个特殊的“双重运动编码器”(Dual Motion Encoder),充当一个翻译官,将你的声音、面部表情和头部动作组合成一条指令传达给虚拟形象。

    • 类比: 这就像是一个完美的舞伴,能完美镜像你的动作。如果你前倾,他也前倾;如果你后退,他也后退。

3. 学习如何变得“生动”(偏好技巧)

最难的部分之一是如何教会虚拟形象表现得富有表现力,而不需要人类去为每一段视频标注“好笑”或“坏点头”。

研究人员使用了一个聪明的技巧,叫做 直接偏好优化 (Direct Preference Optimization, DPO)

  • 工作原理: 他们为同一个时刻创建了两个版本的虚拟形象反应:
    1. “枯燥版”: 一个只听声音而忽略用户脸部的虚拟形象(这是“较不被偏好”的样本)。
    2. “生动版”: 一个既对声音也有反应,也对用户脸部有反应的虚拟形象(这是“被偏好”的样本)。
  • 结果: 系统通过对比来学习。它意识到:“嘿,那个会在用户微笑时也跟着微笑的版本要好得多!”这教会了系统如何通过自我比较来变得更有表现力和反应力,而无需任何人为其编写规则。

4. 结果

当他们测试这个新系统时:

  • 速度: 它非常快,反应时间约为 500 毫秒(半秒)。这个速度足以让人感觉到是在进行真实的、实时的对话。
  • 质量: 在针对真实人类的测试中,超过 80% 的时间内,人们更喜欢这个新颖的虚拟形象而非之前的最优模型。人们认为它感觉更自然、更有响应性且更具参与感。
  • 视觉效果: 虚拟形象的唇形依然与单词完美匹配,但现在的头部动作和面部表情感觉更加鲜活,并与正在与之交谈的人紧密相连。

总结

Avatar Forbing 就像是将一个数字木偶升级为一个实时的对话伙伴。通过使用“边画边涂”的方法(Diffusion Forcing)以及教会系统偏好生动反应而非僵硬反应(偏好优化),虚拟形象终于可以进行自然、往复的对话,它会像人类一样,对你的微笑、点头和动作做出即时反应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →