Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation
本文介绍了 Crayotter,这是一个通过群体相对偏好反向传播(GRPB)训练的 9B 参数量视频编辑智能体,它将主观的长程编辑反馈转化为序数比较,从而有效地在语义片段之间重新分配权重,进而通过 AgenticVBench 等基准测试,表现优于专有系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为一名电影导演。你给它一堆原始视频片段,并给出一个简单的指令:“制作一段酷炫的运动集锦。”机器人必须完成大量工作:它要找到合适的片段、进行剪辑、在时间轴上排列它们、添加音乐,最后导出最终文件。这是一个包含许多步骤的长过程。问题在于,你只能在最后看到最终的电影。如果电影很无聊,你很难判断是哪个具体步骤出了问题。是它选错了片段?是它剪得太短了?还是它排列的顺序不好?在人工智能领域,这被称为“长程”(long-horizon)问题。这就像是通过只在吃完整个蛋糕后告诉某人“味道不好”来教别人烤蛋糕一样。你需要一种方法,即使结果是主观的——即不同的人对同一个视频可能有不同的喜好——也能将功劳(或责任)归于导致该结果的具体步骤。
这篇论文介绍了一种教导这些 AI 编辑的新方法,称为 Crayotter。研究人员意识到,与其试图给整个视频一个单一的“评分”(因为“好”是因人而异的,这很难),不如直接问:“在两个不同版本的同一个视频之间,哪一个更好?”通过比较由完全相同的初始材料制作的视频,AI 可以学习到一个清晰的排名。但棘手的部分仍然是搞清楚在如此漫长的过程中,AI 究竟是在哪里做出了好的或坏的选择。作者提出了一种名为 组内相对偏好反向传播(Group-Relative Preference Backpropagation, GRPB) 的方法。把它想象成一个聪明的裁判,它不仅仅是在比赛结束时大喊“干得好!”或“干得差!”,而是观察整个团队的表现,弄清楚谁为胜利做出了贡献,并把功劳归于那些真正重要的特定球员(或者在这种情况下,特定的编辑步骤),同时确保没有任何一个步骤获得过多的功劳或承担过多的责任。
问题所在:“黑盒”视频编辑
当 AI 尝试编辑视频时,它会经历一系列决策链。它分析素材、挑选片段、构建时间轴并渲染出最终产品。问题在于,最终视频的质量——故事的流畅度、节奏感是否合适、风格是否符合要求——只有在所有这些决策完成后才可见。
如果你只是在最后给 AI 一个数字(比如“这个视频是 7 分(满分 10 分)”),这会让人感到困惑。这个 7 分是因为 AI 选了烂片段?还是因为音乐太响了?还是因为这项任务本身就非常困难?不同的编辑任务对于什么是“好”视频有着不同的规则,因此跨任务比较分数就像是在拿苹果和橘子做比较。
论文指出,我们不应该试图计算一个完美的全局得分。相反,我们应该关注比较。如果 AI 制作了三个不同版本的同一段运动集锦,我们可以很容易地说:“版本 C 比版本 A 好,而版本 A 比版本 B 好。”这把一种模糊、主观的感觉变成了一个清晰、逻辑性的顺序。
解决方案:GRPB 与“滞后”信用系统
作者引入了 组内相对偏好反向传播(GRPB)。它是如何工作的,我们可以用一个有趣的类比来说明:
想象一场烹饪比赛,三支队伍(A 队、B 队和 C 队)被给予完全相同的食材,并被要求做一锅炖菜。一位评委品尝了三份作品并进行了排名:C 队是冠军,A 队第二,B 队是输家。
在旧的方法中,评委可能只会给获胜队伍一个大奖杯,给失败的队伍一个参与奖。但这并不能告诉厨师们他们做对了什么或做错了什么。C 队获胜是因为他们把洋葱切得更好?还是因为他们在正确的时间加入了香料?
GRPB 就像是一位超级聪明的教练,他会拆解比赛:
- 小组(The Group): 它只比较使用完全相同食材(相同的请求和原始片段)的队伍。
- 零和博弈(The Zero-Sum Game): 它将排名视为一场零和博弈。如果 C 队获胜,它就会获得积分,而其他队伍则会失去积分。房间里的总积分始终为零。
- 滞后分配器(The Lagged Allocator): 这是聪明之处。教练不仅仅是看最后的炖菜并进行猜测。它使用了一个“滞后”系统。它查看上一批烹饪课程来决定如何为这一批分配功劳。这可以防止教练被自己的即时反应所迷惑。这就像一位老师根据她上周写下的评分标准来给考试打分,而不是根据她在评分时随手涂鸦的标准。
- 片段级信用(Segment-Level Credit): 它没有给整个团队一个分数,而是将烹饪过程分解为片段:“切菜”、“炖煮”、“调味”。它能弄清楚哪个特定片段对胜负贡献最大。如果 C 队切洋葱切得完美,那么那个特定步骤就会获得功劳;如果 B 队把大蒜烧焦了,那个特定步骤就会承担责任。
- 安全上限(Safety Caps): 为了防止 AI 变得过于兴奋或过于沮丧,系统为任何单个步骤能获得的功劳或责任设置了“上限”。它还使用了一个“可靠性门控”,这意味着只有在确定其评判系统运作正常时,它才会开始分配功劳。
他们的发现
研究人员构建了一个拥有 90 亿参数的 AI 模型,名为 Crayotter,并使用这种新方法对其进行训练。他们在模拟环境中测试了各种现实的编辑任务,从简单的剪辑到复杂的、多步骤的修改。
结果显示,GRPB 比其他方法效果更好:
- 更好的编辑能力: 与使用标准方法训练的模型相比,由 GRPB 训练的模型制作的视频更受人类评委青睐。在一次盲测中,GRPB 模型在面对“基础(Base)”模型(原始 AI)时,胜率达到了 67.1%。
- 更聪明的信用分配: 当研究人员测试 AI 是否知道自己为什么制作了一个好的视频时,GRPB 在精准定位重要的编辑步骤方面表现得更好。它正确识别出“获胜”片段的概率为 20.8%,而其他方法仅为 11.9%。
- 击败专业选手: 在一个名为 AgenticVBench 的标准基准测试中,9B 参数的 Crayotter 模型在所有测试系统中排名第三,击败了多家大型科技公司的昂贵且专有的系统。它的平均得分是 15.7%,其中在“重塑内容(Repurpose)”任务(与视频编辑非常相似)上的得分高达 23.0%。
为什么这很重要
这篇论文表明,对于那些“正确答案”是主观的复杂创意任务,我们不需要一个完美的得分。我们只需要一种方法,去比较不同的尝试,并找出哪些具体步骤导致了更好的结果。通过使用一个比较相似尝试的系统,延迟自己的判断以避免偏差,并仔细地将功劳分配给过程的特定部分,AI 可以学习如何成为一名更好的编辑。
作者谨慎地指出,这是针对像视频编辑这样具有明确阶段和替代结果的任务的特定解决方案。他们并不声称这解决了所有的 AI 问题,但他们展示了对于这类“长程”创意工作,将问题分解为局部、可比较的偏好是一种教导机器如何创作的强大方式。他们的实验代码和数据都是公开的,邀请他人可以在自己的创意 AI 项目上尝试这种“滞后信用”方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。