Aurora: Unified Video Editing with a Tool-Using Agent
本文提出了 Aurora,这是一个代理式视频编辑框架,它采用工具增强的视觉 - 语言模型将原始用户请求转化为结构化编辑计划,从而解决文本和视觉信息不足的问题,以提升统一视频扩散变换器的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想编辑一段家庭视频,但脑海中只有一个模糊的概念。你告诉视频编辑:“让背景里的那个人看起来像个超级英雄”,但你既没有说明是哪个超级英雄,也没有明确指出那个人具体站在哪里。
在当前的人工智能视频编辑领域,这就是一个问题。大多数先进的人工智能模型就像才华横溢但过于死板的厨师。它们能烹饪任何菜肴,但前提是你必须提供一份完美的食谱,包含确切的食材和精确的用量。如果你只是说“加点辣”,它们可能会误加盐而不是胡椒,或者干脆拒绝烹饪,因为它们不知道“辣”具体是什么样子。
Aurora 是一个新系统,它通过在厨师面前增加一位智能助手来解决这个问题。
问题所在:“缺失的食材”鸿沟
当前的人工智能视频编辑模型功能强大。它们可以替换物体、移除人物或更改背景。但它们有一条严格的规定:在开始工作之前,必须万事俱备。
- 如果你想用一条“博柏利格纹围巾”替换一件衬衫,人工智能需要那张特定围巾的图片。
- 如果你想移除一个人,人工智能需要一张(掩膜)地图,精确显示那个人所在的位置。
- 如果你说“让它更快”,人工智能需要知道“它”指的是什么。
普通人通常不会提供这些细节。我们给出的指令往往是模糊的。论文将这种情况称为“定义不足”。人工智能已准备好工作,但用户尚未提供它启动所需的工具。
解决方案:"Aurora"团队
作者创建了 Aurora,它像一个两人团队一样运作:
智能体(智能助手):这是一个大型人工智能模型(视觉语言模型),充当项目经理。它倾听你模糊的请求(“让那位女士的衬衫看起来像一条博柏利围巾”),并意识到:“等等,我没有那条围巾的图片,而且我需要确切知道她的衬衫在哪里。”
- 它去购物:它使用工具在网上搜索博柏利围巾的图片。
- 它绘制地图:它使用工具在视频中找出女士衬衫的确切轮廓。
- 它重写食谱:它将你随意的请求转化为超级详细、技术性的指令,让视频编辑能够完美理解。
视频模型(厨师):这是实际的视频编辑引擎(一种“扩散变换器”)。它不直接与你对话。它只接收来自智能体的完美、预先打包好的指令。它利用源视频、新的围巾图片和衬衫轮廓,完成神奇的编辑工作。
现实生活中的运作方式
论文展示了这一机制的实际应用示例:
- 场景 A:你说:“用一条博柏利围巾替换那位女士的衬衫。”
- 没有 Aurora:人工智能可能会猜测一条普通围巾,或者失败。
- 有 Aurora:智能体搜索真实的博柏利围巾图片,在视频中定位衬衫,并告诉视频模型:“这是视频,这是确切的围巾图片,这是确切的衬衫位置。开始吧。”
- 场景 B:你说:“移除那个行人。”
- 没有 Aurora:人工智能可能会移除错误的人,或者留下一个杂乱的空洞。
- 有 Aurora:智能体确定哪个人是行人,在他们周围绘制精确的轮廓,并明确告诉视频模型要擦除什么,以及用什么填充背景。
结果:新的基准
研究人员建立了一个名为 AgentEdit-Bench 的新测试。该测试专门设计用于用模糊指令来“难倒”人工智能。
- 当他们用这些模糊请求测试标准人工智能模型时,得分很低(约 67-70%)。
- 当他们加入 Aurora 智能体后,得分显著跃升(高达 87.9%)。
论文还表明,这种“智能助手”不仅仅适用于他们特定的视频模型。他们用其他视频编辑模型进行了测试,智能体依然能帮助它们表现得更好。这就像给任何厨师配备了一个通用翻译器;无论谁在烹饪,只要食材先被正确准备好,食物的味道就会更好。
总结
Aurora 不仅仅是编辑视频;它在开始编辑之前理解你的意图。它通过充当一个使用工具的智能体来弥合人类模糊性与机器精确性之间的鸿沟,该智能体收集缺失的图片、绘制缺失的地图并编写清晰的指令,确保最终视频完全符合你的构想。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。