← 最新论文
💻 computer science

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

本文介绍了UMo,这是一种统一的稀疏运动建模架构,它利用空间稀疏的混合专家框架和以关键帧为中心的时序稀疏设计,实现了具有精确音动对齐的高保真实时语音驱动虚拟人动画。

原作者: Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《UMo:面向实时共语数字人的统一稀疏运动建模》的解读,通过简单概念和日常类比进行拆解。

核心难题:“沉重的背包”

想象一下,你正在构建一个能像真人一样说话和活动的数字角色(数字人)。你希望它能即时响应,仿佛正在进行一场实时对话。

当前技术的难题在于,这就像要求一名学生在参加赛跑(实时速度)的同时,背着一个装满厚重教科书(复杂数据)的巨大背包。

  • 太慢:如果模型试图逐帧计算每一个动作,它就会陷入泥潭,导致数字人的动作滞后于语音。
  • 太笨拙:如果试图通过简化数学运算来加快速度,数字人的动作就会变得像机器人或木偶,失去人类手势和面部表情的自然流畅感。

解决方案:UMo(“智能导演”)

作者们创建了 UMo,这是一个像电影智能导演一样的新系统。它不是试图立即以高清画质拍摄电影的每一秒,而是利用三个巧妙的技巧,让数字人既自然又即时地动起来。

1. “专业团队”(空间稀疏性)

类比:想象一个建筑工地。如果你让一个总承包商去盖屋顶、铺管道和刷墙,他可能会顾此失彼,或者每件事都做得平平无奇。
UMo 的做法:UMo 雇佣了一支专家团队(称为混合专家模型,Mixture-of-Experts)。

  • 一位专家只负责手部动作。
  • 一位专家只负责面部动作。
  • 一位专家处理上半身,另一位处理腿部。
    当数字人需要挥手时,“手部专家”主导;当它需要微笑时,“面部专家”接手。它们不会同时工作;只有当前时刻所需的特定专家会被“激活”。这保持了系统的快速,因为它不对那些没有移动的身体部位进行不必要的计算。

2. “关键帧草图”(时间稀疏性)

类比:想想动画师是如何绘制卡通的。他们不会绘制角色奔跑的每一帧。首先,他们会绘制关键帧——最重要的姿势(起跑、腾空、落地)。然后,他们只需填补这些画面之间的空白。
UMo 的做法:UMo 不是每秒预测 30 或 60 帧动作,而只预测关键帧(关键姿势)。

  • 它首先计算“重要”的时刻。
  • 然后,一个轻量级的“填空”网络(插值)迅速绘制出这些关键时刻之间的平滑动作。
    这就像跳过电影中无聊的部分,只看高光时刻,然后用快进按钮填补其余部分。这节省了巨大的时间。

3. “分段对话”(自回归设计)

类比:想象试图一口气写完一篇长文章。这是不可能的。但如果你一句一句地写,甚至一个字一个字地写,你就能跟上思路的流动。
UMo 的做法:实时对话是分段进行的。UMo 不会等到整句话说完才开始动作。它监听一小段“音频片段”,预测该片段的动作,然后立即进入下一个片段。

  • 它使用“滑动窗口”来记忆最近的过去(刚刚说了什么),同时预测即将到来的未来。
  • 这确保了数字人像真实对话中的人一样即时做出反应。

训练过程(“练习方案”)

为了确保该系统运行良好,研究人员并没有简单地将数据扔给它。他们采用了一个三阶段训练配方

  1. 基础:他们教导模型掌握运动的基础知识,并分别理解文本和音频。
  2. 对齐:他们专门练习将音频与动作进行匹配,确保手势与词语相符。
  3. 实时演练:最后,他们训练模型以它在现实世界中工作的方式,即“分段”方式,将所有内容整合在一起。

他们还使用了一种称为音频增强的技巧。由于他们没有足够的人类说话视频来训练 AI,他们使用计算机语音生成器让许多不同的声音朗读同一段脚本。这教会了数字人理解词语的含义和语音的节奏,而不仅仅是死记硬背某一个人的声音。

结果:快速且自然

在测试 UMo 时:

  • 速度:它实时运行(约每秒 44 帧),意味着语音和动作之间几乎没有延迟。
  • 质量:动作比以往的方法更自然、更具表现力。数字人看起来不僵硬;它像人类一样利用手和脸来强调重点。
  • 平衡:它成功实现了既快速又高质量,通过使用专业团队和关键帧草图技术,解决了“沉重背包”的问题。

简而言之:UMo 是一个数字木偶师,它不试图同时控制每一根线。相反,它为特定的身体部位聘请专家,只规划最重要的姿势,并即时填补其余部分,从而实现逼真、实时的对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →