Video = World + Event Stream
本文介绍了 Wan-Streamer v0.3,这是一种实时音视频交互模型,它将视频构建为持久的“世界”与动态“事件流”的结合,从而实现对环境变化和智能体行为的低延迟、通用型预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在看一部电影,但你不仅仅是坐着观看,而是置身于场景之中,与角色交谈,而他们也会立即对你做出回应。这就是实时人工智能的精彩世界——在这里,计算机试图理解并响应我们,就像人类朋友一样迅速。为了实现这一点,AI 需要同时处理三件事:它看到的(视频)、它听到的(音频)以及它所说或所做的(文本和动作)。长期以来,让 AI 在不产生延迟的情况下完成这一切,就像是背着沉重的背包跑马拉松一样,既缓慢又笨重。研究人员一直提出的核心问题是:如何教会 AI 理解它所处的“舞台”以及舞台上正在发生的“动作”,从而让它的反应自然且即时?
Wan-Streamer v0.3 应运而生,这是来自阿里巴巴集团 Wan 团队的一项新成果。你可以将这篇论文看作是一个超级快速、超级聪明的数字演员的巧妙配方。作者们意识到,与其将一段视频视为一个巨大且混乱的、不断变化的像素堆,不如将其拆解为两个简单的部分:世界(World)和事件流(Event Stream)。“世界”是稳定的部分——你所在的房间、家具、人的脸庞以及背景噪音。它变化不大。“事件流”则是所有发生变化的部分——人的行走、说话、挥手或汽车驶过。通过教会 AI 理解视频仅仅是“世界”加上“事件流”,他们发现了一种让 AI 在预测下一步发生什么时变得更聪明、更快速的方法。
核心理念:舞台与剧目
该论文提出了一种看待视频的新视角。想象一个剧院。**“世界”是舞台设计:彩绘的背景、灯光、道具以及演员的服装。一旦戏曲开始,这些东西基本保持不变。“事件流”**则是剧目本身:演员走过舞台、大声喊出一句台词、掉落一个道具或转身。
在过去,AI 模型试图同时学习整个剧目和整个舞台设计,这非常困难。Wan-Streamer v0.3 提出了一个更简单的技巧:先教 AI 学会舞台设计,然后只专注于剧目。
研究人员在海量的现实世界视频上训练了他们的模型。他们不仅仅是要求 AI 猜测下一帧画面,而是教会它观察一个“世界”(比如一条阳光明媚的郊区街道或一个鸡舍),然后预测“事件流”(比如一个机器人在街上奔跑,或者一位女性在喂鸡)。模型学习到了这种模式:如果一个机器人在人行道上,它可能会冲向一辆车,打开车门并开车离开;如果一位女性在鸡舍里,她可能会走向水桶并舀起饲料。通过学习这些模式,AI 构建了一种关于事物如何合理地移动和变化的“世界知识”。
魔法技巧:同时说话与行动
那么,这究竟能实现什么呢?团队在实时、全双工音视频交互上测试了这个想法。“全双工”是一个高级术语,意思是指 AI 可以像真实的对话一样,在不等待你结束发言的情况下,同时进行说话和倾听。
在这个新版本(v0.3)中,AI 代理不再仅仅是一个“会说话的头”。它现在可以进行自由形式的行为(free-form behavior)。
- 旧方式: AI 可能只是在说话时点头或看着你。
- 新方式: AI 可以说:“(拿起咖啡杯喝了一口)谢谢你的提醒,”或者“(微微皱眉)你是什么意思?”
论文解释说,AI 以一种特殊的“角色扮演”格式编写其回复。它将说话内容与括号中的动作混合在一起。因为 AI 已经理解了“世界”(环境和角色),所以它知道如果它说“(拿起杯子)”,视频生成器实际上会展示角色拿起一个符合场景的杯子。这一切都是实时发生的,语音、动作和视频都保持着完美的同步。
速度:快到足以让人感到真实
这篇论文最令人印象深刻的部分之一是,他们在引入这种新智能的同时并没有牺牲速度。作者展示了 Wan-Streamer v0.3 保持了与前一版本(v0.2)相同的极速性能。
- 视频质量: 它仍然以 640×368 的分辨率输出视频。
- 流畅度: 它以 25 FPS(每秒帧数)运行,足以看起来自然流畅。
- 速度: AI 自身思考并生成响应大约需要 200 毫秒。当你把互联网传输数据的时间(预算为 350 毫秒)计算在内,等待回复的总时间约为 550 毫秒。
为了让你有个直观的概念,550 毫秒不到一秒钟。这个速度足以让对话感觉像是与朋友进行真实的聊天,而不是一个等待加载条的机器人。
这意味着什么(以及它并不意味着什么)
论文指出,通过将“世界”与“事件”分离,我们可以创造出更灵活的 AI。它可以针对任何类型的视频进行训练,然后专门用于不同的任务,比如机器人穿梭于房间,或者游戏中的角色。作者展示了这种方法对于他们特定的测试案例——一个能够实时说话并行动的数字角色——是行之有效的。
然而,论文谨慎地指出,这只是一个特定的演示。他们证明了模型可以做到这一点,并且测量了速度和质量。他们并未声称解决了 AI 领域的所有问题,也没有列出所有可能的未来用途。他们只是展示了一种看待视频生成的新方式,这种方式让 AI 对世界的运作方式有了更聪明的理解,同时保持了足以让你现在就能与之聊天的速度。
简而言之,Wan-Streamer v0.3 就像是给了数字演员一份剧本,上面写着:“这是舞台,这是你的服装,这是故事。现在,去表演、去说话、去行动,而且要在我的眨眼之间完成。”由于这种全新的“世界 + 事件”技巧,它似乎确实做到了这一点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。