← 最新论文
🤖 machine learning

Wan-Streamer v0.2: Higher Resolution, Same Latency

Wan-Streamer v0.2 是一个针对端到端视听交互模型的低延迟升级版本,通过采用一种由单个 GPU“思考者”处理感知与语言状态、由多 GPU“表演者”组并行处理高分辨率视频生成的拆分架构,将输出分辨率从 192x336 提升至 640x368,同时保持约 550 毫秒的端到端延迟。

原作者: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zh
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在与一位非常聪明、实时互动的数字朋友进行视频通话。在上一代技术(v0.1)中,你的朋友虽然能说话和移动,但看起来就像屏幕上的一个微小且模糊的缩略图。你可以看到他们的脸,但如果他们移动双手,或者桌上放着一杯咖啡,你也看不清细节。

Wan-Streamer v0.2 是这次升级,它让你的数字朋友看起来更加清晰、形象更大,且不会让对话感到“卡顿”或缓慢。以下是他们实现这一目标的原理,用简单的语言解释如下:

1. 目标:更大的画面,同样的速度

团队希望将视频质量从微小的低分辨率视图(192 像素高)升级到更清晰的中等尺寸视图(640 像素高)。

  • 问题: 通常情况下,提高视频清晰度需要更多的计算能力,这会拖慢整体速度。如果你让视频变得更好,对话通常就会出现延迟。
  • 结果: 他们成功让视频清晰度提升了 3 倍(可以看清你朋友的姿态、手部动作以及周围的房间),同时保持反应时间完全不变。它听起来仍然像是一场实时的对话,而不是一段延迟的视频消息。

2. 秘诀:“思考者”与“表演者”

为了获得这种速度,团队将数字朋友的大脑分成了两个截然不同的角色,它们像接力赛队伍一样协同工作:

  • 思考者(快速管理者):
    想象一位坐在办公桌前的超级高效、反应极快的经理。这个人倾听你的话语,阅读你的文字,并迅速决定你的朋友下一步该说什么。他们非常高效,仅占用一个计算芯片(GPU)。他们的唯一职责就是确保对话能够即时流动。他们不需要操心绘制华丽的背景,只需将“指令”(称为 K/V 切片)传递给下一个人。

  • 表演者(艺术创作团队):
    想象一群在大型工作室里协同工作的艺术家。这个团队负责实际“绘制”出高质量的数字朋友视频。因为画面现在变得更大、更细腻了,单个艺术家无法完成得足够快。所以,他们使用了一种特殊的团队协作方法,称为**“Ulysses 式上下文并行”(Ulysses-style context parallelism)**。

    • 把这想象成一群画家共同绘制一幅巨大的壁画。每位画家同时负责壁画的不同部分。
    • 他们会即时共享进度,使最终的画面完美融合。
    • 因为“思考者”只向他们发送最核心的指令,所以“表演者”团队可以全身心地投入到让视频看起来极其精美的工作中,而不会拖慢对话速度。

3. 为什么这很重要

在旧版本中,你的数字朋友就像是一个被困在狭窄视频框里的人——你只能看到他们的脸。
v0.2 中,你的朋友现在正站在一个房间里。你可以看到:

  • 他们的视线方向(注视点)。
  • 他们是如何摆弄双手的。
  • 放在桌子附近的物体。
  • 他们所处房间的布局。

4. 魔力数字:550 毫秒

论文提到了一个特定的数字:550 毫秒(大约半秒钟)。这是从你说话到你的朋友做出反应的总时长。

  • “思考者”与“表演者”的协作确保了即使视频现在变得更沉重、更详细,反应总时间仍能保持在同样的半秒钟水平。
  • “思考者”处理快速思考(200 毫秒),而“表演者”在后台处理绘制视频的繁重任务,同时还考虑到了网络延迟(数据在互联网上传输所需的时间)。

总结: Wan-Streamer v0.2 就像是从一个颗粒感十足、近距离特写的摄像头聊天,升级到了一个清晰的高清视频通话,你可以看到数字朋友的全身以及周围的环境,而且完全不需要等待视频加载。他们通过雇佣一位快速的“思考者”来管理对话,并使用一支“表演者”团队来并行绘制画面,实现了这一目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →