VicEdit: Learning to Edit Videos from Visual In-Context Examples
本文介绍了 VicEdit,这是一个通过利用新的大规模数据集(VicEdit-400K)以及诸如模态自适应语义蒸馏(Modality-Adaptive Semantic Distillation)和双上下文注入(Dual-Context Injection)等新技术,来有效地将视觉上下文示例与文本指令相结合,从而实现卓越编辑性能的统一视频编辑框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
多年来,编辑视频的梦想一直是只需告诉计算机该做什么。如果你想改变电影场景中汽车的颜色,或者将阴云密布的天空替换为日落,你可以输入像“让天空变成橙色”这样的句子,然后软件会尽力尝试。这种被称为“基于指令编辑”的方法已经取得了显著的进展。它依赖于强大的人工智能模型,这些模型能够理解语言并能从无到有地生成图像和视频。然而,一个根本性的问题仍然存在:语言往往过于模糊,无法捕捉到场景中特定的外观和感觉。一段文本描述可以说“红色的车”,但它无法轻易传达出确切的红色色调、光线照射在金属上的方式,或是车辆特定的运动轨迹。当计算机仅凭一句话来猜测这些细节时,结果往往看起来不对劲,会出现颜色漂移、物体位置错误或动作显得僵硬且不自然等问题。
为了解决这个问题,研究人员开始探索一种不同的教导计算机的方式:向它们展示示例,而不仅仅是口头告知。这个概念被称为“上下文学习”(in-context learning),类似于人类学徒学习手艺的过程。学徒不是阅读一本关于如何粉刷墙壁的手册,而是观察一位大师如何在特定的表面上施加特定的笔触。通过观察原始墙面与完成效果之间的关系,学徒学会了精确的技术。在视频编辑领域,这意味着为计算机提供视觉参考——例如一张图像、一对展示前后变化的图像,甚至是一段显示所需变化的短视频。过去的挑战在于,没有单一的系统能够同时处理所有这些不同类型的视觉线索,而且也没有大规模的示例库来教会系统如何有效地使用它们。
现在,一支研究团队通过一个名为 VicEdit 的新系统填补了这一空白。他们的工作代表了一种重大的转变,即从仅仅依赖文本描述转向使用视觉示例作为主要的引导。为了构建这个系统,团队首先创建了一个庞大的训练数据库。他们生成了 40 万个高质量的示例,并将这个数据集命名为 VicEdit-400K。这个收藏之所以独特,是因为它涵盖了十种不同类型的编辑任务,从改变整个场景的风格到添加或移除特定物体。至关重要的是,这个库中的每个示例都配有与之对应的视觉参考:用于风格变化的单张图像,用于空间变化的图像对,或者是用于复杂运动的视频对。这个庞大的库让计算机学会了如何解读视觉线索,其精准程度是仅靠文本永远无法达到的。
他们新系统的核心是一种允许计算机根据接收到的视觉线索类型来调整其理解的方法。当计算机看到单张图像时,它学会了关注纹理和色彩;当它看到一对图像时,它学会了理解物体如何从一个位置移动到另一个位置;当它看到一对视频时,它学会了遵循时间和运动的流向。研究人员设计了一个过程,从视觉示例中提取这些特定的经验,并将其与书面指令相结合。这确保了计算机不仅仅是盲目地遵循文本,而是利用视觉示例将变化锚定在现实之中。例如,如果用户要求将一个水瓶变成一个发光的星系,文本提供了构思,但一个发光星系的视觉示例则确保了计算机确切知道那是什么样子的,从而防止产生平庸或扭曲的结果。
这种方法的结果令人瞩目。在与现有方法进行对比测试时,该新系统始终能产生更高质量、且更符合用户意图的视频。在其他系统难以保持物体位置正确或维持正确风格的任务中,这种新方法取得了成功。它能够将新物体无缝融入场景,在不扭曲前景的情况下改变背景,或者应用看起来自然且连贯的复杂艺术风格。该系统证明了,通过向计算机展示该做什么,而不是仅仅告诉它,视频编辑的质量会得到显著提升。这项工作为视频编辑树立了新的标准,证明了视觉示例是引导人工智能的强大且必要的工具。研究人员已将他们的数据集和系统开放给他人使用,为未来更精确、更具创造性的视频编辑工具开启了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。