Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
本文提出了 RVEDiT,这是一种基于指令的视频编辑新型扩散 Transformer 框架,通过实施粒度路由的令牌条件化以实现从粗到细的处理,并采用参考锚定的注意力对齐来规范隐式推理,从而在不增加推理成本的情况下提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing》(对齐即推理:视频编辑扩散 Transformer 中的隐式推理)的通俗解释,辅以生动的类比。
宏观图景:教机器人剪辑电影
想象你有一段家庭野餐的视频,你想告诉电脑:“把狗换成柯基犬,但让孩子们和背景保持原样。”
这被称为基于指令的视频编辑。听起来很简单,但实际上对人工智能来说是一个巨大的思维难题。电脑必须同时搞清楚三件事:
- 改什么:(那只狗)。
- 留什么:(孩子们、草地、天空)。
- 如何保持运动:(柯基犬需要与原始狗的运动同步奔跑,且背景不应闪烁)。
该论文的作者认为,当前的人工智能视频编辑器就像过度劳累的实习生,被同时塞进了一堆杂乱无章的指令和一堆杂乱无章的照片,却没有任何清晰的方法来组织思路。它们经常搞砸,改错了东西,或者让视频看起来充满故障。
这篇论文介绍了一个名为RVEDiT(Reasoning Video Editing Diffusion Transformer,推理视频编辑扩散 Transformer)的新系统,它教导人工智能在开始编辑之前以结构化的方式“思考”。
问题所在:为何当前人工智能举步维艰
作者指出,当前的人工智能模型存在两个主要的结构性缺陷:
1. “一刀切”的大杂烩
- 类比:想象一位厨师试图烹饪一道复杂的菜肴。当前的人工智能在开始时,将食谱(文本指令)、原材料(视频像素)和烹饪说明全部扔进同一个搅拌机里。
- 结果:人工智能感到困惑。它试图在理解宏观目标(例如“让它看起来像梵高的画”)的同时,去弄清楚微观细节(例如“这个特定的像素是一片叶子”)。因为所有东西都混在一起,人工智能往往会丢失主要意图,或者搞砸细节。
2. “蒙眼”练习
- 类比:想象一个学生学习绘画。老师让他们画一幅画,却只根据最终结果(像素)来评分。老师从不查看学生是如何混合颜色的,也不看他们在画布上的视线落在哪里。
- 结果:人工智能学会靠运气猜对像素,但它并没有真正学会视频中特定部分为何要改变的逻辑。这就像一个死记硬背答案的学生,却不懂数学原理。
解决方案:RVEDiT
作者构建了一个包含两个巧妙技巧的新框架,以解决这些问题。
技巧一:“行政助理”与“细节工人”(粒度路由令牌条件化)
RVEDiT 不再将所有信息扔进搅拌机,而是根据人工智能大脑层级的“深度”来分离工作。
- 类比:把人工智能想象成一家建筑公司。
- 浅层(管理层):这些层级只看到来自一位聪明助理(多模态大型语言模型)的“摘要笔记”。笔记写道:“我们要把狗换成柯基犬。”管理层专注于宏观计划。他们暂时不会被草地的纹理或天空的颜色分散注意力。
- 深层(执行层):一旦计划确定,“工人”就会获得完整细节。他们看到实际的视频像素和具体文本。他们采纳管理层的计划,并将其应用到视频的具体位置。
- 优势:这创造了一个由粗到细的过程。人工智能首先决定做什么,然后弄清楚怎么做。这防止了人工智能因试图同时做两件事而感到困惑。
技巧二:“影子教练”(参考锚定注意力对齐)
这个技巧帮助人工智能学习编辑的逻辑,而不仅仅是最终画面。
- 类比:想象一位舞蹈教练在教学生。
- 学生(编辑分支):试图跟着音乐(指令)跳舞。
- 影子教练(参考分支):在练习期间,教练观看一段完美舞者做完全相同动作的视频。教练不跳舞,只是观看。
- 对齐:老师强迫学生模仿完美舞者移动眼睛和身体的方式(即“注意力”),而不仅仅是最终的姿势。
- 论文中的运作方式:
- 人工智能在成对的视频上进行训练:原始视频和完美的编辑版本。
- 它运行一个“影子教练”分支来观察完美视频。
- 它迫使“学生”分支将其内部的“视线”(注意力)与“教练”对齐。
- 关键点:影子教练仅在训练期间使用。当人工智能实际被客户使用时,教练就会消失。人工智能已经学会了逻辑,因此不再需要教练。这意味着该系统运行快速且免费。
结果:它有效吗?
作者在名为OpenVE-Bench的标准基准上测试了 RVEDiT。
- 得分:RVEDiT 击败了所有其他开源视频编辑工具。
- 亮点:它在以下方面表现尤为出色:
- 局部修改:在不破坏场景其余部分的情况下,将一个物体替换为另一个物体。
- 局部添加:将新物体(如一个漂浮的花瓶)放入视频中,使其看起来真正属于那里(阴影、运动等)。
- 一致性:当相机移动时,视频不会闪烁或出现故障。
一句话总结
RVEDiT 通过赋予视频编辑人工智能一个两步思考过程(先计划,后执行)以及一种训练方法(教导它如何观看视频,而不仅仅是最终画面应该是什么样子),从而修复了视频编辑人工智能,实现了更清晰、更合乎逻辑的编辑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。