Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing
本文介绍了 RefineCut,一种用于可执行视频编辑的开源权重规划器,它利用确定性验证器来蒸馏多教师修复并精炼偏好,使一个 8B 模型在无需在推理过程中调用教师模型的情况下,就能在新的基准测试上超越前沿教师模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一个常见的区别将创造新图像的行为与组织现有图像的行为区分开来。虽然许多系统已经学会了从零开始绘制像素,将一个简单的想法转化为一张全新的图片,但编辑视频的挑战却大不相同。现实世界的视频编辑与其说是生成新的光影,不如说是做出系列严格的决策。一名编辑必须观察一堆现有的素材,决定保留哪些片段,确定每个片段播放的时长,确定它们的位置,并确保剪辑与配乐的节奏相匹配。这个过程是一个约束的谜题:最终的视频必须有特定的长度,包含某些场景,排除其他场景,并且与音乐完美同步。对于计算机而言,要做到这一点,它不能仅仅靠猜测;它必须遵循一个可以根据规则列表进行检查的计划。
一个研究团队通过将视频编辑视为一种可验证的规划任务,而非创意的猜测游戏,解决了这一问题。他们构建了一个名为 RefineCut 的系统,该系统教导一个紧凑的、开源的计算机模型来创建这些编辑计划。不同于以往依赖大型闭源模型来猜测正确答案的方法,RefineCut 使用了两步学习过程。首先,它接收来自几个强大的 AI 老师的混乱且往往相互冲突的建议,并将其通过一个严格的自动化检查器。这个检查器就像一个数字编辑,会对每一项提议的更改进行测试,对照清晰的需求列表,例如“视频必须为 30 秒长”或“必须包含这个特定片段”。只有通过测试的建议才会被保留,作为学生模型学习的范例。这确保了模型学习的是经过验证的成功案例,而不是模仿老师们的错误或猜测。
随后,研究人员引入了第二阶段训练,让模型学习如何改进自己的工作。模型不再等待人类或老师来给它的编辑打分,而是生成几种可能的修复方案,并由自动化检查器根据其符合规则的程度进行评分。模型随后被训练为倾向于选择得分最高的修复方案。这个循环使系统能够不断完善自身的规划能力,直到它可以完全独立运行,而无需向更大、更昂贵的 AI 求助。其结果是一个能够接收视频简短描述、素材库和一套规则,并生成详细、可执行计划的系统。
为了测试这种方法,团队创建了一个名为 RefineCut-Bench 的新基准测试,其中包含数千个编辑任务、真实的视频片段、音乐轨道以及明确的约束列表。他们发现,当模型直接从强大的 AI 老师的原始建议中学习时,表现很差,在其特定的测试量表上仅获得 0.620 的分数。然而,一旦模型使用经过验证、经检查器批准的建议进行训练,其性能显著提升至 0.858。在经过第二阶段自我改进(即模型学习选择自身修复方案中的最佳方案)后,分数进一步上升至 0.924。这个最终版本的模型规模相对较小且高效,其表现已达到甚至超过了它最初试图模仿的那些更大、更复杂的 AI 系统。
该研究明确排除了“仅仅通过模仿强大 AI 模型的输出就能解决此问题”的想法。研究人员表明,当模型尝试直接模仿老师时,它会继承老师的错误和不一致性。成功的关键在于中间的验证步骤。通过在将任何可能的编辑决策用作教学工具之前,先将其重放于自动化检查器中,系统过滤掉了噪声,只保留了可靠的路径。这种方法在不同的 AI 模型类型中都表现出了稳健性,而不仅仅局限于他们开始使用的那个模型,这表明验证和检查工作的能力比模型本身的规模更为强大。
研究人员还测试了这些规划能力的提升是否转化为了实际的视觉质量。他们让人类评委对由新系统生成的(与旧方法相比经过左右随机化 A/B 测试的)预览图(故事板渲染图)进行盲测。评委们一致更倾向于由 RefineCut 系统制作的视频,这证实了改进后的规划分数对应着更好的视觉效果。该系统能够处理复杂的请求,例如替换特定场景、调整节奏以匹配节拍,或确保总时长精确无误,同时避免了困扰未经验证模型的常见错误,如缺失片段或时长不匹配。
这项工作证明,对于涉及严格规则和结构化决策的任务,如果能通过一种可靠的自我检查方式进行训练,较小的开源模型可以超越庞大的闭源系统。研究人员并未声称已经解决了视频创作的所有方面,例如判断剪辑的艺术品味或理解复杂的情感故事,这些对机器来说仍然很困难。然而,他们成功展示了视频编辑的机械性方面——即选择、排序和定时片段以满足一系列要求——可以通过一个经历规划、检查和自我修正循环的系统来掌握。用于这些实验的代码和数据集现已公开,允许其他研究人员基于这种经过验证的规划方法开展后续研究。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。