← 最新论文
💻 computer science

Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation

Visko Orbis 1.0 是一个实时交互式模型,能够生成每秒 24 帧、时长一小时的 4K 实时视频,并允许动态切换提示词,且通过一个受限的多尺度记忆系统来保持一致的质量与风格。

原作者: Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xiao Jin, Yubo Yuan, Qing Yin, Jie Yang, Zhengzhong Tu

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xiao Jin, Yubo Yuan, Qing Yin, Jie Yang, Zhengzhong Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一部电影,但你不仅仅是坐下来欣赏故事的发展,你还是导演、编剧和主角于一身。你可以喊出“卡!”并中途改变剧情,而电影会根据你的新想法立即更新下一场戏。这就是实时交互式视频生成的梦想。长期以来,用计算机制作视频就像烤蛋糕:你混合好原料(提示词),等待它烘烤(生成),一旦出炉,任务就完成了。如果你想再加点巧克力豆,你必须从头开始。但如果能在蛋糕烘烤时伸手进烤箱修改配方,而蛋糕能瞬间做出调整呢?那就是“实时模型”(Live Models)的世界。这些程序不仅仅是回答一个问题然后停止,它们会持续运行,就像电子游戏中的一个持久角色,随时准备在你给出指令的瞬间做出反应。最大的挑战一直是如何保持故事的一致性。如果你在故事中途改变了情节,角色会忘记自己是谁吗?背景会变成一片模糊的混乱吗?视频会陷入循环吗?科学家们一直试图构建一个能够处理这种长篇且多变的故事,而不至于让系统“发疯”或丢失风格的系统。

Visko Orbis 1.0 登场了,这是一个全新的系统,它就像一位超级聪明、不知疲倦的视频导演,永不眠。把它想象成一个神奇的故事讲述者,可以连续编织一个小时的视频故事;如果你突然决定:“其实,把天空变成紫色,让狗飞起来吧”,视频不会崩溃或重启。相反,它会将你的新想法无缝地织入正在进行的故事中,并在不到一秒的时间内展示出变化。开发团队构建的这个系统不仅能制作 5 秒钟的短片,它还能构建一个可以持续数小时的“直播流”。他们称之为“实时模型”,因为它保持着活跃和持续的状态,承载着过去一分钟和过去一小时发生的记忆,因此即使情节发生转折,角色和场景也能保持一致。

那么,这个魔术技巧是如何运作的呢?想象一下,视频并不是一次性生成的,而是由被称为“块”(chunks)的微小、隐形的乐高积木组成的。系统构建完一个块,接着构建下一个,再下一个。其核心秘诀是一个特殊的“记忆库”,它能抓住重要的细节——比如主角衬衫的颜色或森林的风格——而不会被信息塞满。随着视频变得越来越长,系统会将较旧、较远的记忆(比如“30 分钟前发生了什么”)压缩成摘要,同时保持近期过去(最后几秒钟)的高清状态。这使得视频可以运行数小时而不会让计算机感到困惑,或者让色彩漂移成奇怪的绿色调。

论文显示,该系统可以以 4K 视频(超清晰、高画质)和 24 帧每秒(标准流畅电影速度)进行实时生成。这意味着你可以看着视频在屏幕上生成的同时进行观看,并且你可以在任何时刻输入新的提示词——无论你是在制作动画、直播还是虚拟伴侣——视频都会立即更新。研究人员将其与其他顶尖系统进行了对比,发现 Visko Orbis 1.0 在保持视频观感、遵循指令以及长时间运行的稳定性方面表现最佳。事实上,当人类玩一个游戏,需要从一堆选项中选出最好的长视频时,他们选择 Visko Orbis 1.0 的频率高于任何其他系统,尤其称赞了它随时间推移展现出的稳定性和可靠性。

团队不仅建造了引擎,还教会了它如何从海量的视频库中学习,过滤掉糟糕的视频,并整理好优秀的视频,以便 AI 能够学会讲述逻辑通顺的故事。他们甚至加入了一个特殊的“物理检查”,以确保当球被扔出去时,它会像真实的球一样落下,而不是像一个漂浮的气球。其结果是一个将视频生成从静态、一次性的任务,转变为人类与机器之间生动、呼吸着的对话的工具。这不仅仅是在制作一段视频;这是在让一个故事保持生命力,随时准备根据你的意愿改变方向,而永远不会丢掉叙事的线索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →