← 最新论文
💻 computer science

UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking

UniLS 提出了一种首个仅凭双轨音频驱动、通过两阶段训练范式(先学习无音频运动先验再微调以响应语音线索)实现端到端统一生成说话与倾听表情的框架,有效解决了倾听动作僵硬问题并显著提升了自然度与多样性。

原作者: Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 UniLS 的新技术,它的目标是让虚拟数字人(Avatar)在对话时,不仅能说话,还能自然地倾听

想象一下,你和一个虚拟朋友聊天。以前的虚拟人有个大毛病:当你说话时,它要么像个木头人一样呆立不动(因为不知道该怎么反应),要么只会机械地动嘴皮子。而 UniLS 就是为了解决这个“木头人”问题而生的。

我们可以用三个生动的比喻来理解这项技术:

1. 核心难题:为什么以前的虚拟人“听”得像个僵尸?

在以前的技术中,训练虚拟人“说话”很容易,因为声音和嘴巴的动作是强相关的(比如发“啊”音,嘴巴就要张大)。这就像学骑自行车,脚踩踏板(声音)和车往前跑(动作)是紧密绑定的。

但是,训练虚拟人“倾听”却很难。当你听别人说话时,你的反应(眨眼、点头、微笑)并不是完全由对方的声音决定的,更多是你自己的习惯和当下的情绪

  • 以前的做法:试图直接让声音控制动作。结果模型发现:“哎呀,对方说话的声音和我脸上的微表情没啥关系,为了保险起见,我还是别动了吧。”于是,虚拟人就开始“摆烂”,变成了一张毫无生气的扑克脸。
  • UniLS 的洞察:倾听其实是由两部分组成的:“内在的惯性”(我自己习惯怎么动)+ “外在的提示”(对方说话的节奏)。

2. 解决方案:两阶段“特训”法

UniLS 没有试图一步登天,而是设计了一个**“先练内功,再学互动”**的两阶段训练法,就像培养一个优秀的演员:

第一阶段:练“内功”(无音频训练)

  • 场景:让虚拟人看各种各样的视频(新闻、访谈、闲聊),但不听声音
  • 任务:只观察人脸是怎么动的。
  • 目的:让它学会**“自然的惯性”**。就像教一个演员在没有台词时,如何自然地眨眼、微点头、眼神流转。它学会了:“即使没人说话,我也应该偶尔眨眨眼,偶尔动一下头,这样才像个活人。”
  • 比喻:这就像让演员在后台练习“默剧”,学会如何自然地呼吸和存在,而不依赖剧本。

第二阶段:学“互动”(双轨音频微调)

  • 场景:现在给它看对话视频,并且给它两个人的声音(说话人的声音 + 倾听者的声音)。
  • 任务:在刚才学会的“自然惯性”基础上,根据对方的声音进行微调。
  • 目的
    • 自己说话时,嘴巴跟着自己的声音动(像以前一样)。
    • 听别人说话时,保持刚才练好的“自然惯性”(眨眼、点头),同时根据对方说话的节奏和情绪稍微调整一下(比如对方激动时,你也跟着点头;对方停顿,你眼神聚焦)。
  • 比喻:这就像演员上台了。他不再死板地等指令,而是带着刚才练好的“自然状态”,根据对手戏演员的台词节奏,即兴发挥,做出最自然的反应。

3. 成果:从“木头人”到“灵魂伴侣”

通过这种两阶段的方法,UniLS 取得了惊人的效果:

  • 说话更准:口型对得严丝合缝。
  • 倾听更真:这是最大的突破。以前的虚拟人听你说话时像个雕塑,现在的 UniLS 会自然地眨眼、微微点头、眼神跟随
  • 数据说话:在“倾听自然度”的指标上,比以前的方法提升了 44.1%。这意味着它不再是那个呆板的机器人,而是一个有血有肉、懂得倾听的对话伙伴。
  • 实时运行:它不仅能生成高质量的动作,还能跑得飞快,支持实时对话(每秒 560 帧),这意味着你可以直接用它来开视频会议或玩游戏,没有延迟。

总结

简单来说,UniLS 就像给虚拟人装了一个**“大脑”**。
以前的虚拟人听到声音只会机械地动嘴;
UniLS 告诉虚拟人:“先学会像人一样自然地活着(第一阶段),然后再根据别人的话,自然地做出反应(第二阶段)。”

这项技术让数字人从“只会背台词的演员”进化成了“懂得倾听和互动的真实伙伴”,让未来的虚拟对话变得更加温暖和自然。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →