← 最新论文
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer 是一个后训练框架,它通过结合采用混合强制策略训练的因果生成器、用于长时程稳定性的 DMD 蒸馏,以及用于语音规划的外部语言模型,实现了实时、长篇幅的文本到音视频流式传输,从而实现高速、同步且一致的数字人生成。

原作者: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人讲故事。你希望它能同时说话、动嘴唇并改变面部表情,就像真人一样。长期以来,最优秀的机器人只能做到这一点极短的时间片段,比如一段 5 秒钟的问候。它们的工作方式就像一位在拍摄场景前先看完整个剧本的导演,通过预看后续来决定当前动作。但在现实世界中,我们没有时间等待整个故事写完才开始说话。我们需要机器人在仅基于已说出内容的情况下,现在就开始说话,同时保持面部和声音完美同步。这就是“实时流式传输”的挑战。问题在于,如果机器人在第一秒犯了一个微小的错误,这个错误会随着时间的推移不断累积,导致机器人的脸部看起来很怪异,或者声音偏离主题。科学家们一直试图研究如何让这些数字虚拟化身进行长达数分钟的交谈,而不至于失去理智或节奏。

于是有了 Vorch-Streamer,一个像超级组织有序的实时讲述者一样的全新系统。Vorch-Streamer 并不试图在说话前背诵整个剧本,而是使用一种巧妙的两部分策略来让表演持续进行超过两分钟而不中断。把它想象成一支正在进行长篇即兴演奏的乐队。通常情况下,如果音乐家弹错了一个音符,整首歌可能会变得混乱。但 Vorch-Streamer 有一个特殊的“排练”模式。首先,它练习演奏短小的片段,并接受一位老师(一个知道如何完美执行的预训练模型)的温和纠正。然后,它练习从头到尾演奏完整的一首歌,但这一次,它会倾听自己之前的错误,并学习如何在进行中即时修复它们,同时由一位“指挥”(一个 AI 规划器)准确地告诉它接下来该说什么词。

结果是,一个数字虚拟化身可以同时生成视频和音频,速度达到 27.12 帧/秒 (FPS)。为了让你有个直观的概念,标准视频播放速度为 24 FPS,这意味着这个机器人的速度实际上比实时还要快!它可以让自己的面部看起来始终是同一个人,嘴唇与词汇完美同步,并且在近两分钟的时间里保持声音清晰准确。研究人员发现,如果没有一个专门的“规划”步骤来决定接下来要说什么,机器人就会变得困惑,开始说胡话或不断重复。通过添加这个规划器,该系统成功解决了如何在不需要预知未来的情况下,让长对话流畅进行的难题。这证明了你可以将一个强大但缓慢、掌握完整故事的机器人,转化为一个快速、现场表演、且只需掌握足够信息即可让演出逐秒持续下去的表演者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →