← 最新论文
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1 是一款实时交互式视频生成模型,能够让用户通过语音指令控制数字角色,在消费级 GPU 上生成无限长度、高质量的 540p 视频,帧率高达 42 FPS 且无视觉退化。

原作者: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zh
发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一部电影,其中的角色无论你如何对着屏幕大喊大叫,都听不见你的声音。你无法命令他们挥手、表现出惊讶或切换场景;你只能坐下来,等待导演完成整个剪辑过程后才能看到结果。这就是目前大多数视频生成 AI 的工作方式:你输入一个请求,等待很长时间,然后得到一段完成的片段。但如果能在角色被创造的过程中与他们对话呢?如果你能说,“嘿,比个赞!”而他们能在对话过程中立即做出反应呢?这就是实时交互式视频生成的梦想。这个领域正试图弥合静态、预制电影与实时对话的流动性、即时性之间的鸿沟。为了实现这一点,科学家们正在构建的模型不仅仅是“一次性画出”一整幅画,而是通过“流式传输”视频帧的方式,根据你的声音进行实时反应,就像人类演员根据导演的即时指令进行即兴表演一样。

迎来 Vidu S1,这是一个全新的模型,它就像一个反应极快、从不掉链子的超级数字演员。该项目的研究人员希望解决“离线”视频生成的问题,即在那种你必须等待几分钟甚至几小时才能得到结果的情况下。相反,他们构建了一个系统,让你可以通过声音实时控制一个数字角色。把它想象成一个视频游戏角色,它不仅仅是遵循预先写好的剧本,而是倾听你的语音指令并立即做出反应,无论你要求他们挥手、坐下,还是用手比出一个爱心的形状。酷的地方在于,这不仅仅适用于短短几秒钟;论文表明,Vidu S1 可以让这种交互持续“无限”长的时间,而不会出现角色脸部模糊或动作变得怪异跳跃的问题,这通常是 AI 尝试制作长视频时会出现的问题。

Vidu S1 背后的团队不仅构建了“大脑”,还构建了一个极其高效的“引擎”来使其运行得更快。他们使用了特殊的技巧(他们称之为“TurboDiffusion”和“TurboServe”)将视频生成压缩到普通玩家电脑中常见的图形显卡上。结果如何?该模型可以以 540p 分辨率、42 FPS(每秒帧数)的速度输出视频。为了让你有个直观的概念,标准视频播放速度为 30 FPS,所以这实际上比实时速度还要快,这意味着 AI 可以跟上实时对话而不会出现延迟。研究人员通过让用户上传自己的照片、动漫角色甚至宠物照片进行了测试,然后给出语音指令。模型成功生成了角色遵循指令(如抬起一条腿或竖起大拇指)的视频,同时保持其面部特征与你上传的照片完全一致。

论文解决的最大障碍之一是“漂移”问题。想象一下,你在画一个人的画像,但每当你增加一个新细节时,整幅画就会慢慢开始扭曲和变形,直到那个人看起来像个怪物。许多 AI 视频模型在尝试制作长视频时都会遇到这个问题;视频时间越长,角色的脸部或背景就会变得越发失真。Vidu S1 使用了一个名为“TwinCache”的聪明记忆系统来防止这种情况。这就像是有一位图书管理员,他保留着过去几秒钟的“草图”以保持动作平滑,同时又保留着一个“最终精修版本”以确保角色的脸部清晰且具有辨识度。这使得视频可以永远滚动下去,而角色不会崩坏。

论文还指出,虽然目前存在其他模型,但大多数要么太慢而无法实现交互,要么无法直接理解语音指令,或者在短时间后就会崩溃。Vidu S1 的设计初衷恰恰相反:它将你的声音作为直接指令,即时生成视频,并能根据你的谈话持续稳定运行。在测试中,该模型与其他顶尖系统进行了对比,在指令遵循能力和动作自然度方面均表现出色。研究人员表示,有了这项技术,我们正朝着这样一个未来迈进:你可以与一个看起来、动起来都像真人一样的数字角色进行实时、个性化的对话,而这一切都是在你的电脑上即时生成的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →