这篇论文介绍了一个名为 UniLS 的新技术,它的目标是让虚拟数字人(Avatar)在对话时,不仅能说话,还能自然地倾听。
想象一下,你和一个虚拟朋友聊天。以前的虚拟人有个大毛病:当你说话时,它要么像个木头人一样呆立不动(因为不知道该怎么反应),要么只会机械地动嘴皮子。而 UniLS 就是为了解决这个“木头人”问题而生的。
我们可以用三个生动的比喻来理解这项技术:
1. 核心难题:为什么以前的虚拟人“听”得像个僵尸?
在以前的技术中,训练虚拟人“说话”很容易,因为声音和嘴巴的动作是强相关的(比如发“啊”音,嘴巴就要张大)。这就像学骑自行车,脚踩踏板(声音)和车往前跑(动作)是紧密绑定的。
但是,训练虚拟人“倾听”却很难。当你听别人说话时,你的反应(眨眼、点头、微笑)并不是完全由对方的声音决定的,更多是你自己的习惯和当下的情绪。
- 以前的做法:试图直接让声音控制动作。结果模型发现:“哎呀,对方说话的声音和我脸上的微表情没啥关系,为了保险起见,我还是别动了吧。”于是,虚拟人就开始“摆烂”,变成了一张毫无生气的扑克脸。
- UniLS 的洞察:倾听其实是由两部分组成的:“内在的惯性”(我自己习惯怎么动)+ “外在的提示”(对方说话的节奏)。
2. 解决方案:两阶段“特训”法
UniLS 没有试图一步登天,而是设计了一个**“先练内功,再学互动”**的两阶段训练法,就像培养一个优秀的演员:
第一阶段:练“内功”(无音频训练)
- 场景:让虚拟人看各种各样的视频(新闻、访谈、闲聊),但不听声音。
- 任务:只观察人脸是怎么动的。
- 目的:让它学会**“自然的惯性”**。就像教一个演员在没有台词时,如何自然地眨眼、微点头、眼神流转。它学会了:“即使没人说话,我也应该偶尔眨眨眼,偶尔动一下头,这样才像个活人。”
- 比喻:这就像让演员在后台练习“默剧”,学会如何自然地呼吸和存在,而不依赖剧本。
第二阶段:学“互动”(双轨音频微调)
- 场景:现在给它看对话视频,并且给它两个人的声音(说话人的声音 + 倾听者的声音)。
- 任务:在刚才学会的“自然惯性”基础上,根据对方的声音进行微调。
- 目的:
- 当自己说话时,嘴巴跟着自己的声音动(像以前一样)。
- 当听别人说话时,保持刚才练好的“自然惯性”(眨眼、点头),同时根据对方说话的节奏和情绪稍微调整一下(比如对方激动时,你也跟着点头;对方停顿,你眼神聚焦)。
- 比喻:这就像演员上台了。他不再死板地等指令,而是带着刚才练好的“自然状态”,根据对手戏演员的台词节奏,即兴发挥,做出最自然的反应。
3. 成果:从“木头人”到“灵魂伴侣”
通过这种两阶段的方法,UniLS 取得了惊人的效果:
- 说话更准:口型对得严丝合缝。
- 倾听更真:这是最大的突破。以前的虚拟人听你说话时像个雕塑,现在的 UniLS 会自然地眨眼、微微点头、眼神跟随。
- 数据说话:在“倾听自然度”的指标上,比以前的方法提升了 44.1%。这意味着它不再是那个呆板的机器人,而是一个有血有肉、懂得倾听的对话伙伴。
- 实时运行:它不仅能生成高质量的动作,还能跑得飞快,支持实时对话(每秒 560 帧),这意味着你可以直接用它来开视频会议或玩游戏,没有延迟。
总结
简单来说,UniLS 就像给虚拟人装了一个**“大脑”**。
以前的虚拟人听到声音只会机械地动嘴;
UniLS 告诉虚拟人:“先学会像人一样自然地活着(第一阶段),然后再根据别人的话,自然地做出反应(第二阶段)。”
这项技术让数字人从“只会背台词的演员”进化成了“懂得倾听和互动的真实伙伴”,让未来的虚拟对话变得更加温暖和自然。
1. 研究背景与核心问题 (Problem)
背景:
对话式数字人(Conversational Avatars)旨在实现自然的人机交互。现有的系统大多局限于单向交互:要么只生成说话动作(Speak-only),要么只生成倾听动作(Listen-only)。虽然已有尝试(如 DualTalk)实现说话和倾听的联合生成,但它们通常依赖预先生成的说话者面部序列作为输入,导致无法实现真正的端到端(End-to-End)生成,且难以满足实时性要求。
核心痛点:倾听动作的僵硬(Stiffness)
在尝试直接对“说话 - 倾听”数据进行端到端训练时,生成的倾听动作往往非常僵硬、静态(如“扑克脸”,缺乏眨眼、点头等微表情)。
- 根本原因: 音频与动作之间的相关性不平衡。
- 说话者: 语音音频与面部动作(口型、表情)有强相关性。
- 倾听者: 倾听者的面部动作主要遵循内部的运动先验(如自然的眨眼频率、微点头),仅受外部语音的弱引导。
- 后果: 直接联合优化会导致模型为了“安全”而将倾听分支坍缩为静态的先验分布,无法生成自然多样的倾听反应。
2. 方法论 (Methodology)
为了解决上述问题,作者提出了 UniLS,这是首个仅由双轨音频(说话者和倾听者的音频)驱动的端到端统一说话 - 倾听生成框架。其核心创新在于两阶段训练范式(Two-Stage Training Paradigm)。
2.1 核心洞察
自然倾听行为由两部分组成:
- 内部运动先验 (Internal Motion Prior): 自发的面部动态(如眨眼、微表情、头部姿态),独立于外部语音。
- 外部音频线索 (External Audio Cues): 根据对话语境对内部动态进行调制。
2.2 两阶段训练流程
2.3 技术细节
- 运动表示: 使用 FLAME 3D 形变模型参数(表情 ψ、姿态 θ、形状 β)。
- 编解码器: 采用多尺度时序 VQ Codec,将连续运动量化为离散 Token,用于自回归生成。
- 输入: 仅需双轨音频输入,无需额外的运动数据作为中间条件。
3. 主要贡献 (Key Contributions)
- 首个端到端统一框架: 提出了 UniLS,首个仅由音频驱动即可同时生成自然说话和倾听动作的端到端框架,解决了非端到端方法(如 DualTalk)的实时性瓶颈。
- 两阶段训练范式: 针对倾听动作僵硬问题,创新性地提出“先学内部先验,后学音频调制”的两阶段策略,有效解耦了自发运动与语音驱动。
- SOTA 性能: 在说话准确性和倾听自然度上均达到了最先进水平(State-of-the-Art),显著提升了倾听动作的多样性和真实感。
4. 实验结果 (Results)
实验在 Seamless Interaction 数据集上进行,并与 DiffPoseTalk, ARTalk, DualTalk 等基线方法对比。
4.1 定量结果 (Quantitative)
- 说话准确性: 在唇同步误差 (LVE)、头部距离 (MHD) 及动态偏差 (FDD, PDD, JDD) 上均优于基线,表明口型同步和面部动态精准。
- 倾听质量: 在倾听分布指标上提升显著。
- 相比 DualTalk,倾听分布指标(FDD, PDD, JDD)提升了约 44.1%。
- FID 分数显著降低,表明生成的倾听动作分布更接近真实数据,不再坍缩为静态。
4.2 定性结果 (Qualitative)
- 倾听动作: 生成的倾听者具有自然的眨眼、点头、眼神移动和微表情,消除了基线方法中常见的“僵硬”和“无反应”现象。
- 说话动作: 唇形同步准确,且面部表情与语音韵律协调。
4.3 用户研究 (User Study)
- 25 名参与者进行配对比较。
- 倾听反应 (Listening Reaction): 超过 91.35% 的用户偏好 UniLS 生成的倾听动作(对比 DualTalk),认为其更自然、更具表现力。
- 在所有维度(唇同步、表情自然度、倾听反应、头部姿态)上,UniLS 均显著优于所有基线。
4.4 实时性能
- UniLS 支持实时生成,帧率高达 560.6 FPS(在单卡 RTX 5090 上),且模型参数量较小(421.3M),优于 DualTalk(非实时)和 ARTalk*。
4.5 消融实验 (Ablation Study)
- 移除阶段一: 直接训练导致倾听性能大幅下降,证明学习内部运动先验的必要性。
- 单交叉注意力: 将双轨音频混合输入会导致说话性能下降,证明区分说话/倾听音频通道的必要性。
- 移除多场景数据: 仅使用对话数据训练阶段一会降低模型泛化能力,导致说话和倾听指标均下降。
5. 意义与局限性 (Significance & Limitations)
意义:
- 技术突破: 解决了对话数字人中“倾听”这一长期被忽视且难以建模的痛点,实现了真正的双向自然交互。
- 应用价值: 为实时、高保真的交互式数字人(如虚拟客服、游戏 NPC、元宇宙社交)提供了实用的音频驱动解决方案。
- 范式创新: 提出的“先验学习 + 条件调制”思路为其他生成式任务中处理弱相关性输入提供了新思路。
局限性与未来工作:
- 缺乏语义理解: 当前模型主要基于声学线索(节奏、重音)驱动倾听行为,无法理解对话的语义内容(例如无法根据“同意”或“反对”的语义做出点头或摇头反应)。
- 连续性问题: 基于分块(Chunk-based)的生成方式偶尔会导致长序列运动中的细微不连续。
- 未来方向: 引入语义信息、开发长时序连续生成模型,以构建更具语境感知能力的数字人。
总结: UniLS 通过巧妙的两阶段训练策略,成功打破了音频驱动倾听动作生成的僵局,实现了从“僵硬静态”到“生动自然”的跨越,是构建下一代高保真对话式 AI 的重要基石。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。