OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
OmniMate 是一个统一的框架,通过引入用于自适应响应进度的生成进度控制器(Generation Progress Controller)和用于确保长期跨模态身份一致性的多参考调节模块(Multi-Reference Conditioning Module),实现了高质量、低延迟、开放式的实时流式音视频数字人生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个住在电脑屏幕里的朋友聊天。你希望他不仅仅是说话,还能实时地挥动手部、眨眼,并对你的声音做出反应,就像一个真实的人一样。这就是“交互式数字人(interactive avatars)”的梦想。长期以来,制作这些数字角色就像是在拍电影:在按下“播放”键之前,你必须预先规划好每一句台词和每一个动作。但最近,科学家们开发出了“扩散模型(diffusion models)”,它们就像神奇的画笔,可以根据文本瞬间创造出高质量的视频和声音。这项技术已经变得非常出色,能够让角色实现音画同步。然而,这里有一个难点:这些模型通常在已知对话确切长度时表现最好。如果你尝试进行一场自由流动的对话,让计算机去猜测何时停止说话并开始倾听,角色往往会感到困惑,要么说话停不下来,要么在几分钟后看起来像变了个人。这篇论文正是针对这个问题的:如何打造一个能和你天长地久聊下去、不会丢掉容貌或声音、也不会落后于你语速的数字朋友。
这项研究背后的团队来自西安交通大学和中国电信,他们构建了一个名为 OmniMate 的新系统。你可以把 OmniMate 想象成一个超级聪明的数字木偶师,能够处理永无止境的对话。不同于那些在长对话中或用户打断时可能会踉跄跌倒的旧系统,Omni-Mate 被设计得能够自然流畅,能在“说话”和“倾听”模式之间瞬间切换,同时保持角色的形象和声音始终如一。
OmniMate 成功的秘诀在于它使用了两个巧妙的招数来保持敏锐。首先,它使用了一个叫做**生成进度控制器(Generation Progress Controller, GPC)**的东西。想象一下你在读一本故事书,但你不知道还剩多少页。通常,你可能会读过头,或者停得太早。GPC 就像一个内置的页码计数器,它能准确告诉数字人它的回答还剩多少内容。它为生成的每一小块视频和音频都提供了一个“进度条”。这使得数字人能够精确地知道何时结束句子,并平滑地切换回“倾听”姿态,等待你的下一次输入。如果没有这个,数字人可能会在话讲完后继续说下去,或者陷入尴尬的僵硬状态。
第二个招数是多参考调节模块(Multi-Reference Conditioning Module, MRCM)。你有没有注意到,如果你从一个奇怪的角度看一张照片,那个人看起来可能会有点不一样?在长视频中,数字人经常遭受“身份漂移(identity drift)”的困扰,即他们的脸会慢慢变成另一个人,或者声音也会改变音调。OmniMate 通过不断提醒自己“我是谁”来解决这个问题。它不仅仅盯着视频的第一帧看,而是保留了一个包含多张参考照片和一段人声样本的“记忆库”。当视频播放时,它会不断对照这些参考资料,就像画家在作画时不断瞥一眼肖像画,以确保鼻子和眼睛的位置保持正确,从而确保无论是在说话 10 秒钟还是 10 分钟,角色的长相和声音都保持一致。
团队在模拟真实对话的基准测试集 VerseBench 上对 OmniMate 进行了测试。结果令人印象深刻:该系统可以以 27.64 帧每秒 (FPS) 的速度生成视频和音频,且“首帧时间(time-to-first-frame,即从开始到显示视频所需的时间)”仅为 3.49 秒。这种速度足以让人感觉到是在进行真实的实时对话。在测试中,OmniMate 在长时间保持角色面部和声音一致性方面击败了其他顶尖模型。其他系统在超过一分钟后可能会开始变得模糊或改变声音,而 OmniMate 在长达 240 秒 的测试中依然保持稳定。
不过,作者也谨慎地指出,该系统目前还不完美。如果系统对响应时间的预估出现偏差,数字人可能会切断单词或重复说话。此外,如果角色需要做出一些会导致外观剧烈变化的动作(比如更换一套完全不同的服装),系统可能会在保持身份一致性方面遇到困难。但总的来说,OmniMate 标志着一个重大的进步:它让我们有望拥有能够实时与我们聊天、记得自己是谁、并且能对我们做出反应,而不会出现过去那种尴尬故障的数字朋友。它将当今静态、预设好的视频,转化为未来充满动态、鲜活对话的可能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。