← 最新论文
💻 computer science

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit 引入了一种计划引导编辑框架,该框架利用增强思维链的多模态大语言模型来生成精确的空间先验和属性丰富的指令,从而实现复杂场景下具有更高物体定位能力、物理一致性和时间连贯性的文本驱动视频编辑。

原作者: Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人剪辑一段家庭录像。你不想花好几个小时去学习复杂的软件;你只想说一句,“让那只狗像超级英雄一样飞起来”,然后事情就成真了。这就是*基于指令的视频编辑(instruction-based video editing)*的梦想——在这个领域,计算机试图理解你的自然语言指令,并改变视频中的像素以符合要求。但问题在于:计算机在“常识”方面表现得非常糟糕。如果你告诉机器人“添加一个绕圈飞行的 UFO”,它可能只是把一张 UFO 的图片贴在天上,忽略了重力;或者它可能会在场景中有两只狗时,不小心把错误的狗变成了猫。这就像是给厨师一个食谱,上面写着“加点香料”,却没告诉他们是哪种*香料或加多少*——结果往往一团糟。为了解决这个问题,研究人员正试图弥合模糊的人类语言与视频中精确物理动作之间的鸿沟,确保如果一个球被投掷出去,它会遵循物理定律;并且如果你指向某个特定的物体,计算机能准确知道指的是哪一个。

于是,CoT-Edit 应运而生,它像是一个聪明、循序渐进的视频编辑项目经理。CoT-Edit 不仅仅是让 AI 在接到指令后直接行动并寄希望于结果正确,而是强制 AI 在“行动之前先思考”。作者提出了一个名为**计划—引导—编辑(Plan–Guide–Edit)的三步框架。首先,规划器(Planner)(一个超级聪明的 AI 大脑)观察视频和你的文本指令。它不仅仅是猜测;它使用一种叫做思维链(Chain-of-Thought, CoT)**的技术来分解任务。它通过结构化的推理步骤来分析场景:“那只狗在做什么?它在哪里?如果我要添加一个 UFO,它应该往哪里飞才看起来真实?”随后,它生成一系列归一化的边界框(bounding boxes)来标记物体,并编写一段更详细的、“丰富的”指令,其中包含了物理规则,例如“UFO 必须遵循一条曲线路径”。

接下来,**引导器(Guide)**将这些边界框转化为实际的掩码(masks)——可以把它们想象成数字模板或剪纸形状,告诉计算机确切的作业区域。因为计算机现在拥有了一张清晰的地图(边界框),而不仅仅是一个模糊的概念,所以它不必再去猜测要修改哪只狗,也不必猜测新物体应该落在哪里。最后,编辑器(Editor)(即艺术家)利用这些模板和详细的指令,将新的内容绘制进视频中。这就像是一个画家被告知“画一只鸟”,与被给出一个具体的鸟类轮廓、一份颜色清单以及一条规则(“鸟必须停在树枝上,而不是悬浮在半空中”)之间的区别。

研究发现,这种“先思考后行动”的方法比以往的方法效果显著更好。在测试中,当场景中存在许多相似物体时(例如在黄狗和棕狗之间做出选择),CoT-Edit 在挑选正确物体方面的表现要出色得多;同时,在让新物体以符合物理规律的方式运动方面(例如球的正确弹跳),它也表现得更好。研究人员分两个阶段训练了他们的系统:首先,他们使用混合的公开数据集分别训练了掩码生成器和编辑器;然后,他们将两者结合在一起,在约 10 万对高质量视频编辑对上进行了联合训练。在测试时,CoT-Edit 在几乎所有类别中都超越了其他顶尖方法,包括动作的平滑度以及对用户指令的遵循程度。作者指出,通过在执行“做什么”之前明确规划“在哪里”和“如何做”,他们可以创造出不仅视觉效果惊艳,而且符合人类视觉逻辑的视频编辑作品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →