← 最新论文
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer 是一个原生流式、端到端的交互式基础模型,它在单个 Transformer 架构内统一了语言、音频和视频处理,以实现亚秒级的全双工多模态通信,其模型侧延迟约为 200 毫秒,消除了传统级联系统中固有的误差累积和延迟。

原作者: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu
发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Zoubin Bi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在和一位朋友聊天。你不会等对方说完整个句子,停下来思考,然后再开始说话。相反,你在对方说话时就在倾听,你会点头,保持眼神交流,你可能会用“等等,真的吗?”或者笑声来打断对方,并且在对方还在说话时,你就已经开始构思你的回应了。这就是**全双工(full-duplex)**交互:一切都是同时发生的,重叠且自然地流动。

长期以来,计算机在这方面表现得很糟糕。它们通常像一场接力赛,由不同的选手组成:

  1. 选手 A 听取你的声音并将其转化为文本(语音转文本)。
  2. 选手 B 阅读文本并思考答案(大脑)。
  3. 选手 C 将那个答案转化回语音(文本转语音)。
  4. 选手 D 根据这些话语生成动画脸部(视频生成)。

等到答案传到你的耳朵里时,已经产生了大量的延迟,而且计算机往往会错过你的面部表情,或者因为“选手”之间无法进行足够快的沟通而导致尴尬的打断。

Wan-Streamer 是一种新型 AI,它试图成为一个单一的、超快速的人类,而不是一个接力队。以下是它的工作原理,使用了简单的类比:

1. “一人乐队” vs. “管弦乐队”

目前的多数系统就像一个管弦乐队,小提琴手、鼓手和歌手都在不同的房间里。他们必须等待信号才能开始演奏各自的部分。如果鼓手慢了,整首歌就会拖沓。

Wan-Streamer 就像是一个一人乐队,他可以同时弹吉他、唱歌并保持节奏。它没有独立的模块来分别负责倾听、思考、说话或移动面部。它是一个单一的“大脑”(Transformer 模型),能同时看到你的视频、听到你的声音并阅读你的文本,然后立即决定说什么、用什么语气说以及如何移动面部。

2. “思考者”与“表演者”

为了实现这种惊人的速度,开发者将工作分成了两个角色,它们像指挥家和乐手一样完美同步:

  • 思考者(The Thinker): 这个部分负责倾听你,理解你在说什么,并规划回应。它就像是决定下一个音符的指挥家。
  • 表演者(The Performer): 这个部分负责接收计划,并实际创造出声音和视频。它就像是演奏乐器的乐手。

这里有一个神奇的技巧:当表演者正忙于为你当前的回答创建视频和音频时,思考者已经在倾听你的下一句话,并规划下一个回应。他们在传递接力棒的过程中极其迅速,以至于没有任何等待时间。这使得系统能够跟上实时对话,而不会出现卡顿。

3. “直播” vs. “剪辑好的电影”

旧的 AI 视频系统就像是在剪辑电影:它们要等整个场景拍摄完成后,再将其剪辑在一起。如果你想修改一句台词,它们必须重新剪辑整个片段。

Wan-Streamer 就像是新闻直播。它在发生时逐帧生成视频。

  • 如果你停止说话,AI 不会冻结;它会继续“呼吸”、眨眼并注视着你,就像一个等待你继续说话的真人一样。
  • 如果你打断了 AI,它会立即停止并倾听你,而不是因为“进入状态”而强行完成原本的句子。
  • 它能瞬间对你的面部表情做出反应。如果你看起来很困惑,它可能会放慢速度或解释清楚,这一切都发生在同一个瞬间内。

4. 它有多快?

论文声称该系统非常迅速:

  • AI 的“大脑”时间: 从 AI 听到你、思考到开始生成回应,大约只需要 200 毫秒(0.2 秒)。这比人类眨眼的速度还要快。
  • 总对话时间: 当你把互联网传输信号往返的时间(约 350 毫秒)加在一起,总延迟约为 550 毫秒(0.55 秒)。

换个角度看:如果你在进行视频通话时,朋友有 0.5 秒的延迟,你几乎感觉不到。你可以打断他们,而他们也会自然地做出反应。

它有什么特别之处?

论文强调,Wan-Streamer 不仅仅是将不同的工具“粘合”在一起。它从一开始就学会了同时倾听、说话和移动面部

  • 没有“文本中间人”: 它不需要将你的声音转化为文本,然后再转回声音。它直接理解声音和视频。
  • 自然的节奏: 因为它通过真实的对话进行学习(在真实对话中人们经常互相插话),所以它知道何时停顿、何时点头以及何时介入。它听起来不会机械化或僵硬。

总结

Wan-Streamer 是一个数字人的原型,它可以与你进行实时的面对面交谈。它不仅仅是回答问题;它观察你、倾听你,并用充满生命力的面部和声音对你做出反应,同时让对话流畅进行,没有尴尬的停顿。这是迈向 AI 的重要一步——让它不再像一个计算机程序,而更像是一个坐在你桌对面的真人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →