✨ 要点🔬 技术摘要
想象一下你正在看一部电影,但你不仅仅是坐下来欣赏故事的发展,你还是导演、编剧和主角于一身。你可以喊出“卡!”并中途改变剧情,而电影会根据你的新想法立即更新下一场戏 。这就是实时交互式视频生成 的梦想。长期以来,用计算机制作视频就像烤蛋糕:你混合好原料(提示词),等待它烘烤(生成),一旦出炉,任务就完成了。如果你想再加点巧克力豆,你必须从头开始。但如果能在蛋糕烘烤时伸手进烤箱修改配方,而蛋糕能瞬间做出调整呢?那就是“实时模型”(Live Models)的世界。这些程序不仅仅是回答一个问题然后停止,它们会持续运行,就像电子游戏中的一个持久角色,随时准备在你给出指令的瞬间做出反应。最大的挑战一直是如何保持故事的一致性。如果你在故事中途改变了情节,角色会忘记自己是谁吗?背景会变成一片模糊的混乱吗?视频会陷入循环吗?科学家们一直试图构建一个能够处理这种长篇且多变的故事,而不至于让系统“发疯”或丢失风格的系统。
Visko Orbis 1.0 登场了,这是一个全新的系统,它就像一位超级聪明、不知疲倦的视频导演,永不眠。把它想象成一个神奇的故事讲述者,可以连续编织一个小时的视频故事;如果你突然决定:“其实,把天空变成紫色,让狗飞起来吧”,视频不会崩溃或重启。相反,它会将你的新想法无缝地织入正在进行的故事中,并在不到一秒的时间内展示出变化。开发团队构建的这个系统不仅能制作 5 秒钟的短片,它还能构建一个可以持续数小时的“直播流”。他们称之为“实时模型”,因为它保持着活跃和持续的状态,承载着过去一分钟和过去一小时发生的记忆,因此即使情节发生转折,角色和场景也能保持一致。
那么,这个魔术技巧是如何运作的呢?想象一下,视频并不是一次性生成的,而是由被称为“块”(chunks)的微小、隐形的乐高积木组成的。系统构建完一个块,接着构建下一个,再下一个。其核心秘诀是一个特殊的“记忆库”,它能抓住重要的细节——比如主角衬衫的颜色或森林的风格——而不会被信息塞满。随着视频变得越来越长,系统会将较旧、较远的记忆 (比如“30 分钟前发生了什么”)压缩成摘要,同时保持近期过去(最后几秒钟)的高清状态。这使得视频可以运行数小时而不会让计算机感到困惑,或者让色彩漂移成奇怪的绿色调。
论文显示,该系统可以以 4K 视频 (超清晰、高画质)和 24 帧每秒 (标准流畅电影速度)进行实时生成。这意味着你可以看着视频在屏幕上生成的同时进行观看,并且你可以在任何时刻输入新的提示词——无论你是在制作动画、直播还是虚拟伴侣——视频都会立即更新。研究人员将其与其他顶尖系统进行了对比,发现 Visko Orbis 1.0 在保持视频观感、遵循指令以及长时间运行的稳定性方面表现最佳。事实上,当人类玩一个游戏,需要从一堆选项中选出最好的长视频时,他们选择 Visko Orbis 1.0 的频率高于任何其他系统,尤其称赞了它随时间推移展现出的稳定性和可靠性。
团队不仅建造了引擎,还教会了它如何从海量的视频库中学习,过滤掉糟糕的视频,并整理好优秀的视频,以便 AI 能够学会讲述逻辑通顺的故事。他们甚至加入了一个特殊的“物理检查”,以确保当球被扔出去时,它会像真实的球一样落下,而不是像一个漂浮的气球。其结果是一个将视频生成从静态、一次性的任务,转变为人类与机器之间生动、呼吸着的对话的工具。这不仅仅是在制作一段视频;这是在让一个故事保持生命力,随时准备根据你的意愿改变方向,而永远不会丢掉叙事的线索。
技术摘要:Visko Orbis 1.0
问题陈述
目前的视频生成系统(如 Sora、Veo、Kling)主要运行在离线范式下:用户提交提示词,等待处理,然后接收一个固定的剪辑,且该剪辑无法被更改。虽然这些系统在视觉保真度和短篇生成方面表现出色,但它们无法支持实时交互体验 (即视频在被消费的同时正在被创建,例如直播、交互式叙事、虚拟伴侣)。现有的流式传输或交互式视频尝试通常仅解决了孤立的方面——例如因果流式传输、有限的交互或长程稳定性——但缺乏一个能够同时支持实时用户控制、长时程生成且无质量漂移、以及渐进式交付的端到端系统。此外,为了实时服务此类模型,需要解决与状态复用、并行执行和渐进式超分辨率相关的推理瓶颈问题。
方法论
Visko Orbis 1.0 被定义为一个实时模型(Live Model) :一个在连续时钟下实时生成视频的持久化过程,可以在不重新初始化的情况下接受更新。该系统构建在**分块潜空间视频模型(chunk-wise latent-video model)**之上,该模型在生成连续的时间块时,维持一个受限的多尺度前序展开(rollout)记忆。
1. 数据策展与训练流水线
训练流水线利用多阶段数据引擎对大规模原始视频集合进行过滤、标注和重平衡:
数据处理: 原始视频经过基于镜头感知的剪辑(3–240秒)、分层安全性过滤以及级联质量过滤(评估结构完整性、时间相干性和运动性)。分布重平衡确保了在多样化领域(自然、城市、工业、游戏)的覆盖,以防止模型坍缩至狭窄的视觉风格。
标注(Captioning): 多阶段标注系统生成用于整体监督的单事件描述(single-event captions)以及将动作限定在特定间隔内的 事件对齐时间描述(event-aligned temporal captions) ,使模型能够在单个视频内处理提示词切换。
渐进式训练:
双向预训练: 在 1–5 秒视频上进行训练,以建立强大的视觉先验。
流式适配: 使用线性整流流(rectified-flow)目标,使模型适配于 3–10 秒视频的因果分块生成。
中期训练: 专门针对单事件和多事件数据进行训练,以提高运动自然度和时间相干性。
微调: 使用高质量、人工策划的子集来精炼视觉保真度和事件转换。
后训练: 包括通过蒸馏(移除无条件分支)进行的少步数流后训练(few-step flow post-training) ,以及使用**群体相对强化学习(GRPO)**来优化视觉质量、运动和文本-视频对齐。利用潜空间世界模型为候选未来进行评分,以评估物理合理性。
2. 模型架构与记忆
公式化: 模型生成以文本指令 c k c_k c k 、视觉参考 r k r_k r k 和受限历史 H k H_k H k 为条件的块 z k z_k z k 。指令被视为外部控制;更新仅影响尚未提交的块。
受限多尺度记忆: 为了维持小时级的展开,系统在原生潜空间分辨率下保留近期历史,同时将较早的时段逐步压缩为固定容量的学习状态。这防止了误差累积和色彩漂移,同时保持每块计算量恒定。
超分辨率: 专门的单次精炼视频超分辨率模型 将原生 832 × 480 的块转换为 4K 输出。它采用时间蒸馏自编码器和空间窗口注意力机制,在不引入块间自回归依赖的情况下保持运动一致性。
3. 推理与服务
推理栈旨在实现渐进式交付 和实时交互 :
实时控制: 提示词被异步编码并在块边界处应用。滚动提示词摘要(rolling prompt summary)在交互过程中维持上下文。
优化执行: 系统利用编译后的 Transformer 执行、融合算子以及全序列多 GPU 执行(使用 Ulysses 式序列分片)来最小化延迟。
漂移稳定化: 应用内容自适应控制(如加性扰动、时间 RoPE 缩放和运动感知负向提示词路由)来稳定长时程展开,对抗累积误差。
输出: 流水线以 24 FPS 的速率交付 4K 视频,对提示词更新的平均可见响应时间低于一秒。
核心贡献
统一的实时视频公式: 一个持久的、分块的潜空间流过程,其中视觉状态跨块传递,允许时间索引的指令在不重启展开的情况下改变。这支持了在单一接口下的 T2V、I2V 和 V2V 延续。
事件对齐的数据与训练: 一个多阶段数据引擎,产生时间局部化的描述,并采用从短视频先验到历史条件流式生成的课程学习,包括针对提示词切换和长程稳定性的专门训练。
用于长程生成的受限记忆: 一种机制,可在保留高分辨率近期历史的同时,将较旧数据压缩为固定状态,从而实现小时级的展开而无明显的质量或色彩漂移。
少步数流后训练: 一个结合了引导蒸馏、自我强迫分布匹配和基于 GRPO 的强化学习的流水线,旨在使模型与视频质量奖励和物理合理性对齐。
流式高分辨率系统协同设计: 一个优化的服务流水线,集成了状态复用、单批次序列并行和参考感知超分辨率模型,以实现实时 4K 交付。
结果
论文在涉及 1–3 分钟视频及多次事件切换的 74 个案例中对 Visko Orbis 1.0 进行了评估,并将其与 Helios、Self-Forcing、LongLive 和 Causal-Forcing 等先进系统进行了对比。
定量指标:
DOVER: 获得了最高的审美得分(0.8101)和技术得分(0.5572)。
VideoAlign: 获得了最佳的视觉质量(1.5777)和运动质量(1.8646)得分,以及最高的文本对齐对数似然值(0.1043)。
人类偏好(HPSv3): 记录的帧均值为 8.1018,最小值为 6.9719。
人类偏好竞技场: 在涵盖 9 个系统的侧向对比研究中,Visko Orbis 1.0 获得了最高的综合 Elo 分数(1838)和最高的 时间稳定性 Elo 分数(1940) 。虽然其他系统(如 HappyOyster)展现出具有竞争力的视觉保真度,但 Orbis 在维持连贯的长时程观看体验和处理指令切换方面表现出明显的优势。
长程一致性: 图 1 展示了在 3600 秒(1 小时)的展开过程中,该系统与基准系统相比,能保持稳定的审美质量、提示词对齐度和色彩饱和度(HSV 轨迹),而基准系统则会出现漂移。
意义与主张
论文将 Visko Orbis 1.0 定位为实时模型(Live Model)范式的首次实现。它声称将视频生成的边界从产生受限、静态的剪辑转向维持一个 可控的视觉流 。通过集成状态化生成、事件对齐训练和高效的实时服务,该系统使用户能够在视频展开的过程中持续引导视频生成。作者断言,这项工作推动了视频生成向响应式创意媒介的发展,支持从直播、交互式叙事到机器人技术和虚拟伴侣等广泛的应用,同时在长时间跨度内保持高视觉保真度和时间稳定性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。