想象一下你正在与一位数字朋友进行视频通话。通常情况下,这些数字朋友感觉有些机械化:他们会等待你停止说话,然后给出一个预设好的答案。他们并不会在你说完话的过程中真正地“倾听”,也不会对你的微笑或点头做出即时反应。这感觉就像是一条单行道。
论文 "Avatar Forcing" 介绍了一种让这些数字朋友感觉更像真实对话伙伴的新方法。以下是其工作原理的拆解,通过简单的概念进行说明:
1. 问题所在:“等看式”机器人
目前的数字虚拟形象(Avatar)就像是一个必须等老师讲完整个讲座后才能举手的学生。它们需要看到整个对话(或者至少是几秒钟的对话)之后,才能决定如何移动头部或改变表情。这会导致延迟,使对话显得僵硬且不自然。
此外,当这些虚拟形象在“倾听”时,它们往往只是像雕像一样坐着。它们不知道如何点头、微笑回应或表现出感兴趣的样子,因为它们所训练的数据并没有展示出足够生动、自然的倾听示例。
2. 解决方案:“Avatar Forcing”
作者创建了一个名为 Avatar Forcing 的系统。可以把这理解为教会虚拟形象成为一名“现场”对话者,而不是一名“录制”的对话者。
“即时反应”引擎:
与其等待整个对话结束,虚拟形象使用了一种叫做 Diffusion Forcing 的技术。想象一位画家,他一次只画一小笔,只观察自己已经画出的部分以及用户现在正在做的事情。他不会去观察未来。这使得虚拟形象能够实时做出反应(大约半秒钟的延迟),让对话感觉即时且流畅。
- 类比: 这就像是在玩接球游戏,你扔出球,虚拟形象立即接住并扔回给你,而不是等你扔完十个球才开始。
“双面镜”:
虚拟形象不仅听你的声音,还会观察你的脸部和肢体动作。如果你微笑,虚拟形象也会微笑;如果你点头,它也会点头。它使用了一个特殊的“双重运动编码器”(Dual Motion Encoder),充当一个翻译官,将你的声音、面部表情和头部动作组合成一条指令传达给虚拟形象。
- 类比: 这就像是一个完美的舞伴,能完美镜像你的动作。如果你前倾,他也前倾;如果你后退,他也后退。
3. 学习如何变得“生动”(偏好技巧)
最难的部分之一是如何教会虚拟形象表现得富有表现力,而不需要人类去为每一段视频标注“好笑”或“坏点头”。
研究人员使用了一个聪明的技巧,叫做 直接偏好优化 (Direct Preference Optimization, DPO)。
- 工作原理: 他们为同一个时刻创建了两个版本的虚拟形象反应:
- “枯燥版”: 一个只听声音而忽略用户脸部的虚拟形象(这是“较不被偏好”的样本)。
- “生动版”: 一个既对声音也有反应,也对用户脸部有反应的虚拟形象(这是“被偏好”的样本)。
- 结果: 系统通过对比来学习。它意识到:“嘿,那个会在用户微笑时也跟着微笑的版本要好得多!”这教会了系统如何通过自我比较来变得更有表现力和反应力,而无需任何人为其编写规则。
4. 结果
当他们测试这个新系统时:
- 速度: 它非常快,反应时间约为 500 毫秒(半秒)。这个速度足以让人感觉到是在进行真实的、实时的对话。
- 质量: 在针对真实人类的测试中,超过 80% 的时间内,人们更喜欢这个新颖的虚拟形象而非之前的最优模型。人们认为它感觉更自然、更有响应性且更具参与感。
- 视觉效果: 虚拟形象的唇形依然与单词完美匹配,但现在的头部动作和面部表情感觉更加鲜活,并与正在与之交谈的人紧密相连。
总结
Avatar Forbing 就像是将一个数字木偶升级为一个实时的对话伙伴。通过使用“边画边涂”的方法(Diffusion Forcing)以及教会系统偏好生动反应而非僵硬反应(偏好优化),虚拟形象终于可以进行自然、往复的对话,它会像人类一样,对你的微笑、点头和动作做出即时反应。
技术摘要:Avatar Forcing
问题陈述
目前的谈话头像生成模型主要侧重于从静态肖像创建用于单向通信(如虚拟主持人)的逼真头像。虽然这些模型在唇形同步和基础头部运动方面表现出色,但它们无法复制面对面交流的这种双向特性。它们通常缺乏在实时交互式对话中响应用户言语和非言语线索(如点头、微笑、笑声)的能力。
作者确定了创建真正交互式头像的两个主要挑战:
- 实时因果约束: 现有的方法通常需要获取完整的对话上下文(包括未来的帧)来进行运动生成,这导致了高延迟(例如 >3 秒)。这阻碍了实现自然对话所需的即时反应。
- 学习表现力强的交互: 由于缺乏经过精心策划的数据,自然的交互行为难以建模。现有的倾听数据集往往表现出僵硬、低方差的运动。此外,对用户线索做出反应具有天生的歧义性(一对多映射),这使得模型在没有额外标注数据的情况下,难以学习到生动、多样化的反应。
方法论:Avatar Forcing
论文提出了 Avatar Forcing,这是一个通过在学习到的运动潜空间中进行 扩散强制(diffusion forcing) 来模拟用户-头像交互的实时交互式头部头像生成框架。
1. 用于实时交互的因果扩散强制(Causal Diffusion Forcing)
为了解决延迟问题,该框架在运动潜空间内采用了 因果扩散强制(Causal Diffusion Forcing) 方法,而不是直接生成原始像素。
- 运动潜编码(Motion Latent Encoding): 一个双运动自编码器将输入图像分解为身份潜变量 (zS) 和运动潜变量 (mS)。运动潜变量捕捉了整体头部运动和细粒度的面部表情。
- 双运动编码器(Dual Motion Encoder): 该模块将多模态输入——用户音频 (au)、用户运动 (mu) 和头像音频 (a) ——编码为一个统一的条件。它利用交叉注意力层来对齐用户信号,并学习用户与头像之间的因果关系。
- 因果 DFoT 运动生成器(Causal DFoT Motion Generator): 核心生成器是运行在因果约束下的扩散强制 Transformer (DFoT)。
- 分块因果结构(Blockwise Causal Structure): 潜帧被划分为若干块。模型根据过去的块和当前条件来预测下一个块,从而避免了对未来上下文的需求。
- 前瞻掩码(Look-Ahead Mask): 为了确保块与块之间平滑的临时过渡,引入了一个“前瞻”因果掩码。这允许一个块在保持整体因果性的同时,关注同一块内有限数量的未来帧,从而减轻运动抖动。
- KV 缓存(KV Caching): 系统采用键值(KV)缓存来高效复用过去的信息,从而实现约 500ms 延迟的实时推理。
2. 用于表现力的直接偏好优化(DPO)
为了解决缺乏表现力训练数据以及交互反应存在歧义的问题,作者引入了一种无标签的偏好优化方法。
- 合成偏好对(Synthetic Preference Pairs): 该方法不依赖于人工标注,而是构建偏好对:
- 优选项 (xw): 展示出表现力强、符合语境的反应的地面真值(ground-truth)视频中的运动潜变量。
- 次优项 (xl): 仅由基于头像音频(丢弃用户信号)驱动的基准谈话头像模型生成的运动潜变量。这模拟了“僵硬”或无反应的行为。
- 优化目标: 模型使用 直接偏好优化(DPO) 进行微调。通过将这些合成的“失败”样本(缺乏用户条件)视为较不优选的样本,模型学习增强表现力和反应性,而无需单独的奖励模型或额外的标签。
核心贡献
- 实时交互框架: 一种基于因果扩散强制的新型架构,能够以低延迟(~500ms)生成交互式头像视频,相比于需要完整上下文的方法(如 3.4s)有了显著提升。
- 无标签的表现力学习: 一种利用合成失败样本来教授模型生动、反应性行为的偏好优化策略,克服了现有僵硬数据集的局限性。
- 多模态调节: 一个能有效整合用户音频、用户运动和头像音频以驱动整体头像运动的统一编码器。
实验结果
该框架在二元对话数据集(RealTalk 和 ViCo)上进行了评估,并与诸如 INFP* 和 FLOAT 等最先进的基准模型进行了对比。
- 延迟: Avatar Forcing 实现了 ~0.5s 的延迟,支持实时交互,而 INFP* 为 3.4s。这代表了 6.8 倍的加速。
- 反应性和丰富度: 定量指标(表情/姿态的残差皮尔逊相关系数、多样性相似指数、方差)显示 Avatar Forcing 显著优于基准模型。它实现了更低的 rPCC 分数(表明更好的同步性)和更高的 SID/Var 分数(表明更丰富的、更多样化的运动)。
- 人类偏好: 在一项包含 42 名参与者的研究中,在包括反应性、运动丰富度、非言语对齐和整体偏好在内的各项指标中,Avatar Forcing 在 超过 80% 的案例中优于最强的基准模型(INFP*)。
- 消融实验:
- 移除用户运动输入 (mu) 会导致即使在用户沉默期间(即便存在视觉信号如微笑),头像也会表现出静态行为。
- 移除 DPO 微调会导致面部表情的多样性降低,以及对用户线索的反应减弱。
重要性与主张
论文声称,Avatar Forcing 代表了迈向 真正交互式虚拟头像 的重要一步。通过成功地在实时环境下模拟因果交互,并学习无需额外标签数据的表现力行为,该框架弥合了单向内容生成与双向人类-AI 通信之间的鸿沟。作者将这项工作定位为创建引人入胜的虚拟主持人、主播和能够自然镜像用户表情并提供即时、共情反馈的对话智能体的实用工具。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。