← 最新论文
💻 computer science

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

本文介绍了 JoyAI-Echo-1.5,这是一个统一的音视频生成系统,其包含一个具有跨镜头记忆以实现持久角色一致性的长视频变体,以及一个具有几何相机控制以实现交互式导航的世界模型变体,两者均通过基于展开感知(rollout-aware)的训练进行了优化,从而在长时程叙事和交互式世界生成方面达到了最先进的性能。

原作者: Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:计算机不仅能创作单个视频片段,还能编织出整个故事,让角色从第一场戏到最后一幕都保持一致的外貌与声音;或者让观众漫步于数字景观之中,在转头或向前移动时感受到完美的稳定性。这就是视频生成的领域前沿——在这个领域,人工智能正在学习如何合成动态图像与声音。多年来,这些系统就像是技艺精湛的画家,虽然能创作出美丽的肖像,却难以绘制出一整座画廊,让每一张脸都保持一致;又或者像是一个讲故事的人,讲了几句话就忘了情节。挑战在于如何超越孤立的瞬间,去创造长篇且连贯的叙事以及交互式世界,使它们在不断增长的过程中不会产生偏差或丧失身份特征。

来自“悦未来学院”(Joy Future Academy)的一个研究团队推出了一套名为 JoyAI-Echo-1.5 的新系统,旨在解决这些特定问题。该系统并非仅仅为了制作更好的单段剪辑,而是专注于两个截然不同但又相互关联的目标:创作角色与声音保持一致的长篇故事,以及构建能够精准响应用户动作的交互式世界。研究人员发现,通过赋予计算机一种“记忆”过去场景的方式,并教会它理解运动的几何学,他们可以生成延长的视频序列,使其保持稳定并忠于原始指令。

该系统的第一部分解决了长篇故事的问题。在以往的尝试中,如果一个角色出现在某个场景,随后视频切换到了新地点,该角色回来时可能会看起来略有不同,或者说话的声音发生了变化。JoyAI-Echo-1.5 通过构建一个“记忆库”来解决这个问题。当系统生成故事时,它会保存早期镜头中的特定视觉和音频细节。当角色再次出现时,系统会查阅这一记忆,以确保其面部、服装和声音与之前建立的内容相匹配。它通过查看前一个场景的完整音频来捕捉说话者独特的音调(而非仅仅是短小的片段),并通过保存角色从不同角度拍摄的图像来实现这一点。这使得计算机生成的镜头序列感觉像是一部连续的电影,英雄可以在穿越不同环境的同时不丢失其身份特征。

系统的第二部分是为交互式世界设计的,在这种世界中,用户可能想要控制摄像机来探索数字环境。在过去,给计算机下达诸如“向前移动”或“向左转”之类的指令,往往会导致动作生硬、不自然,或者导致视频播放时场景逐渐扭曲和变形。新系统将这些指令转化为对摄像机如何在空间中移动的精确数学描述。它将世界视为一个独立于摄像机之外的稳定三维空间。当用户移动时,系统会计算精确的路径并据此调整视频,确保无论探索持续多久,墙壁、物体和光影都能保持一致。这实现了一种平滑、连续的体验,使数字世界感觉是坚实且真实的,而非一个摇摆不定的幻象。

为了让这些系统足够快以投入实用,研究人员还开发了一种新的训练方式。通常情况下,创作高质量视频需要许多步计算,这非常耗时。团队教导系统通过“从自身的错误中学习”来提升自己:让系统生成视频,然后立即根据刚刚创建的内容尝试改进该视频。这个过程涉及一种称为“自梯度强制”(self-gradient forcing)的技术,它使系统即使在自主生成长序列时也能保持稳定。他们还使用了一种压缩生成过程的方法,使系统只需经过短短几步即可生成高质量视频,而不会丢失精细的细节或音画同步性。

这项工作的成果已针对其他领先系统进行了测试。在涉及长篇故事的测试中,新系统在保持角色一致性和实现语音与唇动匹配方面,表现优于以往任何模型。在交互式世界的测试中,它在维持环境形状和准确遵循用户移动指令方面,得分高于竞争对手。一项具体的测试显示,系统可以生成一段六十秒的连续视频,期间摄像机穿过一个复杂的场景,系统在整个过程中始终保持正确的透视关系和视觉质量,而其他模型在处理此类任务时往往难以避免场景漂移或变形。

这项研究表明,创造持久故事和稳定交互式世界的关键,在于计算机如何记住过去以及如何理解当下的几何结构。通过将稳健的视觉与音频细节记忆力,与对运动的精确理解相结合,该系统可以生成具有时间连贯性的内容。尽管挑战依然存在,特别是在极长且复杂的运动中保持摄像机完全稳定,但这项工作展示了显著的进步。它表明,人工智能可以超越创建孤立的剪辑,进而支撑起完整的叙事和演进的世界,为更具沉浸感且更可靠的数字体验开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →