想象一下,你正在看一部电影,其中的角色无论你如何对着屏幕大喊大叫,都听不见你的声音。你无法命令他们挥手、表现出惊讶或切换场景;你只能坐下来,等待导演完成整个剪辑过程后才能看到结果。这就是目前大多数视频生成 AI 的工作方式:你输入一个请求,等待很长时间,然后得到一段完成的片段。但如果能在角色被创造的过程中与他们对话呢?如果你能说,“嘿,比个赞!”而他们能在对话过程中立即做出反应呢?这就是实时交互式视频生成的梦想。这个领域正试图弥合静态、预制电影与实时对话的流动性、即时性之间的鸿沟。为了实现这一点,科学家们正在构建的模型不仅仅是“一次性画出”一整幅画,而是通过“流式传输”视频帧的方式,根据你的声音进行实时反应,就像人类演员根据导演的即时指令进行即兴表演一样。
迎来 Vidu S1,这是一个全新的模型,它就像一个反应极快、从不掉链子的超级数字演员。该项目的研究人员希望解决“离线”视频生成的问题,即在那种你必须等待几分钟甚至几小时才能得到结果的情况下。相反,他们构建了一个系统,让你可以通过声音实时控制一个数字角色。把它想象成一个视频游戏角色,它不仅仅是遵循预先写好的剧本,而是倾听你的语音指令并立即做出反应,无论你要求他们挥手、坐下,还是用手比出一个爱心的形状。酷的地方在于,这不仅仅适用于短短几秒钟;论文表明,Vidu S1 可以让这种交互持续“无限”长的时间,而不会出现角色脸部模糊或动作变得怪异跳跃的问题,这通常是 AI 尝试制作长视频时会出现的问题。
Vidu S1 背后的团队不仅构建了“大脑”,还构建了一个极其高效的“引擎”来使其运行得更快。他们使用了特殊的技巧(他们称之为“TurboDiffusion”和“TurboServe”)将视频生成压缩到普通玩家电脑中常见的图形显卡上。结果如何?该模型可以以 540p 分辨率、42 FPS(每秒帧数)的速度输出视频。为了让你有个直观的概念,标准视频播放速度为 30 FPS,所以这实际上比实时速度还要快,这意味着 AI 可以跟上实时对话而不会出现延迟。研究人员通过让用户上传自己的照片、动漫角色甚至宠物照片进行了测试,然后给出语音指令。模型成功生成了角色遵循指令(如抬起一条腿或竖起大拇指)的视频,同时保持其面部特征与你上传的照片完全一致。
论文解决的最大障碍之一是“漂移”问题。想象一下,你在画一个人的画像,但每当你增加一个新细节时,整幅画就会慢慢开始扭曲和变形,直到那个人看起来像个怪物。许多 AI 视频模型在尝试制作长视频时都会遇到这个问题;视频时间越长,角色的脸部或背景就会变得越发失真。Vidu S1 使用了一个名为“TwinCache”的聪明记忆系统来防止这种情况。这就像是有一位图书管理员,他保留着过去几秒钟的“草图”以保持动作平滑,同时又保留着一个“最终精修版本”以确保角色的脸部清晰且具有辨识度。这使得视频可以永远滚动下去,而角色不会崩坏。