想象一下你是一位试图剪辑电影的导演。在过去,计算机就像是笨拙的助手,只能触碰画面。如果你要求它们把晴朗的天空变成暴风雨,它们会变暗云朵,却留下背景中欢快鸟鸣的声音。这看起来很怪异,感觉也不对劲,因为在现实世界中,视觉和听觉是最好的朋友;它们手牵着手,同步移动。这个科学领域被称为多模态编辑(multimodal editing),我们试图教会计算机理解:改变一个视觉动作通常需要同时改变声音,反之亦然。研究人员提出的核心问题是:“我们能否构建出一个不仅仅是更换像素或噪声,而是能理解整个场景,从而不破坏这种魔力的计算机编辑器?”
于是,研究人员创建了一个名为 AVE-Compass 的新“成绩单”,用来评判这些计算机编辑器做得有多好。把它想象成一位超级严厉的影评人,他不仅观看最终的电影,还有一个包含 2,688 个微小细节的检查清单。他会检查编辑器是否遵循了你的指令,是否不小心删除了你想要保留的背景音乐,以及新的雨声是否真的与新的暴风雨天空相匹配。研究人员发现,即使是目前最聪明的计算机仍在苦苦挣扎。它们往往能把视觉部分做对,却搞砸了音频,或者改变了声音,以至于它不再符合画面。这就像一位音乐家弹对了音符,却用了错误的调性,让整首歌听起来都感觉不对劲。
为了解决这个问题,团队构建了一个新的辅助机器人,叫做 AVE-Agent。这个智能体不再只是盲目地尝试编辑视频,而是扮演着一名细心的项目经理的角色。它将你宏大而混乱的需求(比如“让它看起来像一场大暴雨”)分解成一系列微小的、逻辑性的步骤。它会提前规划,在每一步之后检查自己的工作,如果犯了错,它会说:“哎呀,让我再试一次,”然后再继续进行。当他们测试这个新智能体时,它的表现比其他智能体要好得多。它更紧密地遵循指令,保留了那些不该改变的原有声音和景象,并让最终结果看起来和听起来都更加自然。虽然它还不完美,但这种新方法表明,如果我们教会计算机循序渐进地规划和检查自己的工作,它们或许终将成为我们一直期待的可靠的副导演。
技术摘要:AVE-Compass 与 AVE-Agent
1. 问题陈述
尽管基于指令的视频编辑技术已快速发展,但现有的系统和基准测试主要侧重于无声片段的视觉变换或孤立的音频编辑。然而,现实世界的视频由紧密耦合的视听信号组成,其语义产生于视觉动态、前景声音、背景环境音以及语音之间相互作用的结果。目前的模型难以执行复杂的跨模态指令,这些指令需要同步的修改(例如,当动作发生变化时改变声音,或者在移除视觉目标时移除相关的声学痕迹),同时还要保留非目标内容。
现有的基准测试不足以评估这些能力,因为它们:
- 侧重于无声视频的视觉变换或孤立的音频生成。
- 缺乏对跨模态一致性和隐式同步约束的评估。
- 依赖粗粒度的指标,无法诊断音频-视觉编辑中的特定失败,例如背景声音的失真或唇形同步的丢失。
2. 方法论
A. AVE-Compass:一个全面的基准测试
作者引入了 AVE-Compass,一个旨在评估自由形式音视频编辑的基准测试。
- 数据集构成: 它包含 145 个精选源视频(涵盖不同的领域、镜头数和风格)和 196 条音视频耦合的编辑指令。
- 指令类型: 指令分为四个分支:联合音视频、语音、仅视频和仅音频编辑。它们被分为 28 种细粒度的操作类型,并根据物体定位、音频复杂度和跨模态关联度进行了难度标注。
- 评估协议: 该基准测试将性能解耦为四个维度:
- 指令遵循 (Instruction Following, IF): 使用原子化的“是/否”检查清单问题,评估是否将请求的修改正确应用于预期目标。
- 保真度保持 (Fidelity Preserving, FP): 评估非编辑内容(视觉和听觉)是否与源内容保持一致,以及是否引入了非预期的内容。
- 真实感 (Realism, REAL): 使用专门的多模态大语言模型 (MLLM) 评分标准,判断编辑后片段的感知合理性和物理一致性。
- 编辑意图 (Editing Intent, EI): 一个主要指标,定义为 IF 和 FP 的乘积,旨在奖励在完整执行编辑任务的同时保留非目标内容的表现。
- 指标: 评估结合了 MLLM 作为评判者(使用 2,688 个细粒度检查清单项)以及用于跨模态同步(唇形同步、音画同步)、视频质量(美学、主体一致性、运动平滑度)和音频质量(美学、语音质量)的自动化指标。
B. AVE-Agent:一个模块化编辑框架
为了解决现有模型的局限性,作者提出了 AVE-Agent,一个基于规划的智能体框架。
- 规划器智能体 (Planner Agent): 将抽象的用户指令转换为可执行的、具有依赖关系的子任务有向无环图 (DAG)。它分析输入片段,识别显式需求和隐式跨模态后果,并将任务分解为具有可操作评估标准的特定模态子任务。
- 执行器智能体 (Executor Agent): 通过自我检查反思循环,将子任务落实到具体的(视频、音频或语音)操作中。它将高层意图编译为特定工具的提示词,执行任务,并根据规划器标准评估输出。如果输出失败,则通过“改进器 (improver)”重写指导,针对特定错误而非盲目重试。
- 混合评估器智能体 (Mixed Evaluator Agent): 检查组装后的片段,以确定全局连贯性、指令遵循度和保真度。它决定执行代价最小的纠正措施(例如,重新混音、重新生成子任务或重新进行完整规划),以解决检测到的问题,避免不必要的重复计算。
3. 核心贡献
- AVE-Compass 基准测试: 一个包含 145 个视频、196 条耦合指令和 2,688 个检查清单项的综合数据集,专门针对需要同步跨模态编辑和严格保留非目标内容的现实场景。
- 解耦评估协议: 一个涵盖指令遵循、保真度保持、真实感和编辑意图的框架,能够诊断编辑不完整、内容漂移、真实感低和对齐偏差等问题。
- AVE-Agent 框架: 一个模块化的、基于规划的智能体,它将指令分解为子任务,并利用自我反思来提高复杂联合编辑场景下的编辑质量和对齐度。
4. 实验结果
作者在 AVE-Compass 上评估了六个系统(包括 Wan2.7, HappyHorse, Gemini-Omni, Seedance, LTX2 和 AVE-Agent)。
- AVE-Agent 的表现: AVE-Agent 在编辑意图 (59.8) 和指令遵循 (77.3) 方面取得了最高分,显著优于基准模型。它在音频侧指令遵循和音画同步方面表现出特别的提升。
- 基准模型的权衡: 当前模型难以平衡指令遵循和保真度保持。
- 像 LTX2 这样的模型通常通过重新生成整个视频来遵循指令,导致保真度保持能力较差。
- 像 Gemini-Omni 和 Seedance 这样的模型有时会返回原始视频/音频以获得高保真度得分,从而导致未能执行指令(指令遵循度低)。
- 真实感差距: 虽然一些模型取得了较高的自动化质量得分(如视频/音频美学),但它们的真实感得分明显较低,这表明它们在理解物理世界和编辑结果的逻辑有效性方面存在困难。
- 鲁棒性: 与基准模型相比,AVE-Agent 在不同源视频时长、物体定位难度、音频复杂度和跨模态关联度下,表现出更稳定的性能。
- 指标有效性: 研究证实,自动化指标和主观 MLLM 判断在很大程度上是正交的,捕捉了不同的质量维度。人类与 LLM 在评估指标上的共识平均接近 90%。
5. 意义
论文声称,AVE-Compass 和 AVE-Agent 代表了该领域从孤立的像素级修改向物理和感知连贯的多模态编辑迈进的一步。通过系统地评估在执行指令的同时对非目标内容的保留情况,该基准测试揭示了最先进的模型仍然缺乏用于规划跨模态操作和强制执行同步约束的显式机制。所提出的智能体框架表明,通过将复杂指令分解为具有依赖关系的子任务并进行迭代自我反思,可以有效提高联合音视频编辑任务中的编辑质量和对齐度。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。