← 最新论文
💻 computer science

Video = World + Event Stream

本文介绍了 Wan-Streamer v0.3,这是一种实时音视频交互模型,它将视频构建为持久的“世界”与动态“事件流”的结合,从而实现对环境变化和智能体行为的低延迟、通用型预测。

原作者: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zh
发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一部电影,但你不仅仅是坐着观看,而是置身于场景之中,与角色交谈,而他们也会立即对你做出回应。这就是实时人工智能的精彩世界——在这里,计算机试图理解并响应我们,就像人类朋友一样迅速。为了实现这一点,AI 需要同时处理三件事:它看到的(视频)、它听到的(音频)以及它所说或所做的(文本和动作)。长期以来,让 AI 在不产生延迟的情况下完成这一切,就像是背着沉重的背包跑马拉松一样,既缓慢又笨重。研究人员一直提出的核心问题是:如何教会 AI 理解它所处的“舞台”以及舞台上正在发生的“动作”,从而让它的反应自然且即时?

Wan-Streamer v0.3 应运而生,这是来自阿里巴巴集团 Wan 团队的一项新成果。你可以将这篇论文看作是一个超级快速、超级聪明的数字演员的巧妙配方。作者们意识到,与其将一段视频视为一个巨大且混乱的、不断变化的像素堆,不如将其拆解为两个简单的部分:世界(World)事件流(Event Stream)。“世界”是稳定的部分——你所在的房间、家具、人的脸庞以及背景噪音。它变化不大。“事件流”则是所有发生变化的部分——人的行走、说话、挥手或汽车驶过。通过教会 AI 理解视频仅仅是“世界”加上“事件流”,他们发现了一种让 AI 在预测下一步发生什么时变得更聪明、更快速的方法。

核心理念:舞台与剧目

该论文提出了一种看待视频的新视角。想象一个剧院。**“世界”是舞台设计:彩绘的背景、灯光、道具以及演员的服装。一旦戏曲开始,这些东西基本保持不变。“事件流”**则是剧目本身:演员走过舞台、大声喊出一句台词、掉落一个道具或转身。

在过去,AI 模型试图同时学习整个剧目和整个舞台设计,这非常困难。Wan-Streamer v0.3 提出了一个更简单的技巧:先教 AI 学会舞台设计,然后只专注于剧目。

研究人员在海量的现实世界视频上训练了他们的模型。他们不仅仅是要求 AI 猜测下一帧画面,而是教会它观察一个“世界”(比如一条阳光明媚的郊区街道或一个鸡舍),然后预测“事件流”(比如一个机器人在街上奔跑,或者一位女性在喂鸡)。模型学习到了这种模式:如果一个机器人在人行道上,它可能会冲向一辆车,打开车门并开车离开;如果一位女性在鸡舍里,她可能会走向水桶并舀起饲料。通过学习这些模式,AI 构建了一种关于事物如何合理地移动和变化的“世界知识”。

魔法技巧:同时说话与行动

那么,这究竟能实现什么呢?团队在实时、全双工音视频交互上测试了这个想法。“全双工”是一个高级术语,意思是指 AI 可以像真实的对话一样,在不等待你结束发言的情况下,同时进行说话和倾听。

在这个新版本(v0.3)中,AI 代理不再仅仅是一个“会说话的头”。它现在可以进行自由形式的行为(free-form behavior)

  • 旧方式: AI 可能只是在说话时点头或看着你。
  • 新方式: AI 可以说:“(拿起咖啡杯喝了一口)谢谢你的提醒,”或者“(微微皱眉)你是什么意思?”

论文解释说,AI 以一种特殊的“角色扮演”格式编写其回复。它将说话内容与括号中的动作混合在一起。因为 AI 已经理解了“世界”(环境和角色),所以它知道如果它说“(拿起杯子)”,视频生成器实际上会展示角色拿起一个符合场景的杯子。这一切都是实时发生的,语音、动作和视频都保持着完美的同步。

速度:快到足以让人感到真实

这篇论文最令人印象深刻的部分之一是,他们在引入这种新智能的同时并没有牺牲速度。作者展示了 Wan-Streamer v0.3 保持了与前一版本(v0.2)相同的极速性能。

  • 视频质量: 它仍然以 640×368 的分辨率输出视频。
  • 流畅度: 它以 25 FPS(每秒帧数)运行,足以看起来自然流畅。
  • 速度: AI 自身思考并生成响应大约需要 200 毫秒。当你把互联网传输数据的时间(预算为 350 毫秒)计算在内,等待回复的总时间约为 550 毫秒

为了让你有个直观的概念,550 毫秒不到一秒钟。这个速度足以让对话感觉像是与朋友进行真实的聊天,而不是一个等待加载条的机器人。

这意味着什么(以及它并不意味着什么)

论文指出,通过将“世界”与“事件”分离,我们可以创造出更灵活的 AI。它可以针对任何类型的视频进行训练,然后专门用于不同的任务,比如机器人穿梭于房间,或者游戏中的角色。作者展示了这种方法对于他们特定的测试案例——一个能够实时说话并行动的数字角色——是行之有效的。

然而,论文谨慎地指出,这只是一个特定的演示。他们证明了模型可以做到这一点,并且测量了速度和质量。他们并未声称解决了 AI 领域的所有问题,也没有列出所有可能的未来用途。他们只是展示了一种看待视频生成的新方式,这种方式让 AI 对世界的运作方式有了更聪明的理解,同时保持了足以让你现在就能与之聊天的速度。

简而言之,Wan-Streamer v0.3 就像是给了数字演员一份剧本,上面写着:“这是舞台,这是你的服装,这是故事。现在,去表演、去说话、去行动,而且要在我的眨眼之间完成。”由于这种全新的“世界 + 事件”技巧,它似乎确实做到了这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →