← 最新论文
💻 computer science

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar是一个实时、无限流视频生成框架,它利用自回归蒸馏、长短期视觉记忆机制以及推理-反应模块,为音频驱动的虚拟数字人实现了最先进的视觉一致性和意图感知交互。

原作者: Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在通过视频通话与一位数字朋友聊天。通常,这些数字朋友有点像坏掉的木偶:它们可能能够完美地根据你的声音对准口型,但如果你和它们聊得太久,它们的脸可能会开始变得奇怪,或者它们可能会忘记五分钟前自己长什么样。此外,如果你让它们“看下时间”,它们可能只会把时间说出来,却依然眼神呆滞地盯着前方,无法真正看向手表。

InteractiveAvatar 这篇论文介绍了一种构建这类数字朋友的新方法,让它们可以与你进行永不间断且不会显得出错的对话,并且能真正执行你要求做的动作。

以下是他们实现这一目标的原理,通过简单的类比来解释:

1. 问题所在:“失忆症”与“机器人”

作者指出,目前的数字分身主要有两个问题:

  • “漂移”的面部: 如果视频持续运行很长时间,分身的脸会慢慢发生变化。也许眼睛变大了,或者发色发生了偏移。这就像一个画家在不断叠加新的油漆层,却不看原始草图;最终,画出来的东西看起来完全不像最初的那个人。
  • “盲目”的机器人: 目前的分身大多只是“音频驱动”的。如果你说“看下手表”,它们能听到声音并移动嘴巴,但它们并不理解其中的“含义”。它们不会真的转头去看表,因为它们并不“思考”你的请求。

2. 解决方案:由两部分组成的“大脑”

为了解决这些问题,团队构建了一个拥有两个特殊工具的系统:一个记忆系统和一个思考大脑

记忆系统:“短期笔记本”与“长期相册”

为了防止分身的脸部发生漂移,他们创建了一个叫做**长短期视觉记忆(LSVM)**的东西。

  • 短期笔记本: 想象分身保留着过去几秒钟视频的笔记。这确保了当它移动头部时,动作看起来是平滑自然的,而不是僵硬跳跃的。
  • 长期相册: 这是聪明之处。分身并没有试图记住每一帧(那会太重、太慢),而是拥有一个记录重要时刻的“相册”。
    • 运作方式: 随着视频播放,系统会不断询问:“这一帧重要吗?”如果分身戴上了帽子或拿起了一个咖啡杯,系统就会拍一张“快照”并放入相册。如果分身只是静静坐着说话,它可能会跳过快照。
    • 益处: 这起到了锚定的作用。即使在交谈了10分钟后,分身也可以回看它的“相册”并想起:“噢对了,我戴着帽子,”或者“我拿着一个咖啡杯。”这让角色从始至终保持形象的一致性。

思考大脑:“导演”与“场务”

为了让分身理解你的意图,他们添加了一个推理反应模块(RRM)

  • 导演(LLM): 当你说话时,一个强大的 AI“导演”会倾听你。它不仅是在听单词,还在理解你的“意图”。如果你说“看下时间”,导演会意识到:“啊,用户希望分身去看手表。”
  • 状态循环: 系统会在两种模式之间切换:
    1. 动作模式: 分身正忙于做某事(比如看表或坐下)。
    2. 稳定模式: 一旦动作完成,分身会进入一种平静的状态(比如安静地坐着),这样它就不会进行不必要的移动。
  • 快速切换(Cache-Switching): 通常,当指令发生变化时,计算机必须重新计算所有内容,这需要时间。这个系统使用了一个“快速切换”的小技巧。它保留了当前场景计算的备份。当指令改变时(例如,从“站起来”变为“坐下”),它会瞬间用新的备份替换旧的备份,使反应感觉即时且流畅。

3. 结果:实时的、无限的对话

通过将这些工具与一种特殊的训练方法(称为蒸馏,这就像教学生用一步而不是十步来解决问题)相结合,他们创造了一个系统,它能够:

  • 实时运行: 你可以与分身交谈,它会立即做出响应,而没有漫长的等待时间。
  • 持久运行: 你可以进行长达数小时的对话,分身依然会保持原来的样子,拥有相同的衣服和配饰。
  • 理解你: 如果你要求它执行某个动作,它真的会去做,而不仅仅是口头上说说。

总而言之: InteractiveAvatar 就像是给一个数字木偶赋予了长期记忆,让它不会忘记自己的脸,并赋予它一个能理解你的玩笑和请求的大脑,从而实现一场流畅、无尽且真实的对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →