Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Wan-Streamer 是一个原生流式、端到端的交互式基础模型,它在单个 Transformer 架构内统一了语言、音频和视频处理,以实现亚秒级的全双工多模态通信,其模型侧延迟约为 200 毫秒,消除了传统级联系统中固有的误差累积和延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在和一位朋友聊天。你不会等对方说完整个句子,停下来思考,然后再开始说话。相反,你在对方说话时就在倾听,你会点头,保持眼神交流,你可能会用“等等,真的吗?”或者笑声来打断对方,并且在对方还在说话时,你就已经开始构思你的回应了。这就是**全双工(full-duplex)**交互:一切都是同时发生的,重叠且自然地流动。
长期以来,计算机在这方面表现得很糟糕。它们通常像一场接力赛,由不同的选手组成:
- 选手 A 听取你的声音并将其转化为文本(语音转文本)。
- 选手 B 阅读文本并思考答案(大脑)。
- 选手 C 将那个答案转化回语音(文本转语音)。
- 选手 D 根据这些话语生成动画脸部(视频生成)。
等到答案传到你的耳朵里时,已经产生了大量的延迟,而且计算机往往会错过你的面部表情,或者因为“选手”之间无法进行足够快的沟通而导致尴尬的打断。
Wan-Streamer 是一种新型 AI,它试图成为一个单一的、超快速的人类,而不是一个接力队。以下是它的工作原理,使用了简单的类比:
1. “一人乐队” vs. “管弦乐队”
目前的多数系统就像一个管弦乐队,小提琴手、鼓手和歌手都在不同的房间里。他们必须等待信号才能开始演奏各自的部分。如果鼓手慢了,整首歌就会拖沓。
Wan-Streamer 就像是一个一人乐队,他可以同时弹吉他、唱歌并保持节奏。它没有独立的模块来分别负责倾听、思考、说话或移动面部。它是一个单一的“大脑”(Transformer 模型),能同时看到你的视频、听到你的声音并阅读你的文本,然后立即决定说什么、用什么语气说以及如何移动面部。
2. “思考者”与“表演者”
为了实现这种惊人的速度,开发者将工作分成了两个角色,它们像指挥家和乐手一样完美同步:
- 思考者(The Thinker): 这个部分负责倾听你,理解你在说什么,并规划回应。它就像是决定下一个音符的指挥家。
- 表演者(The Performer): 这个部分负责接收计划,并实际创造出声音和视频。它就像是演奏乐器的乐手。
这里有一个神奇的技巧:当表演者正忙于为你当前的回答创建视频和音频时,思考者已经在倾听你的下一句话,并规划下一个回应。他们在传递接力棒的过程中极其迅速,以至于没有任何等待时间。这使得系统能够跟上实时对话,而不会出现卡顿。
3. “直播” vs. “剪辑好的电影”
旧的 AI 视频系统就像是在剪辑电影:它们要等整个场景拍摄完成后,再将其剪辑在一起。如果你想修改一句台词,它们必须重新剪辑整个片段。
Wan-Streamer 就像是新闻直播。它在发生时逐帧生成视频。
- 如果你停止说话,AI 不会冻结;它会继续“呼吸”、眨眼并注视着你,就像一个等待你继续说话的真人一样。
- 如果你打断了 AI,它会立即停止并倾听你,而不是因为“进入状态”而强行完成原本的句子。
- 它能瞬间对你的面部表情做出反应。如果你看起来很困惑,它可能会放慢速度或解释清楚,这一切都发生在同一个瞬间内。
4. 它有多快?
论文声称该系统非常迅速:
- AI 的“大脑”时间: 从 AI 听到你、思考到开始生成回应,大约只需要 200 毫秒(0.2 秒)。这比人类眨眼的速度还要快。
- 总对话时间: 当你把互联网传输信号往返的时间(约 350 毫秒)加在一起,总延迟约为 550 毫秒(0.55 秒)。
换个角度看:如果你在进行视频通话时,朋友有 0.5 秒的延迟,你几乎感觉不到。你可以打断他们,而他们也会自然地做出反应。
它有什么特别之处?
论文强调,Wan-Streamer 不仅仅是将不同的工具“粘合”在一起。它从一开始就学会了同时倾听、说话和移动面部。
- 没有“文本中间人”: 它不需要将你的声音转化为文本,然后再转回声音。它直接理解声音和视频。
- 自然的节奏: 因为它通过真实的对话进行学习(在真实对话中人们经常互相插话),所以它知道何时停顿、何时点头以及何时介入。它听起来不会机械化或僵硬。
总结
Wan-Streamer 是一个数字人的原型,它可以与你进行实时的面对面交谈。它不仅仅是回答问题;它观察你、倾听你,并用充满生命力的面部和声音对你做出反应,同时让对话流畅进行,没有尴尬的停顿。这是迈向 AI 的重要一步——让它不再像一个计算机程序,而更像是一个坐在你桌对面的真人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。