想象一下,你有一段繁忙街道的视频,想要移除画面中正在走过的一名特定行人。过去,试图完成这一任务的 AI 模型就像一群画家:他们不是仅仅涂改那个人,而是每次做出更改时,都要重新绘制整条街道、天空以及背景中的每一辆车。这极其缓慢且浪费,因为 90% 的视频内容根本无需触碰。
本文介绍了YOSE(You Only Select Essential Tokens,仅选择必要令牌),这是一种新方法,它像一个智能的外科手术式编辑器。YOSE 不会重绘整个画布,而只修复需要修正的特定区域,同时确保新绘制的部分与未触碰的部分完美融合。
以下是 YOSE 的工作原理,分解为简单概念:
1. 问题:“整块画布”方法
当前的 AI 视频工具(基于一种称为"DiT"的技术)在移除物体方面表现很好,但速度很慢。即使你只想从视频中移除一只小鸟,计算机也会处理整段视频的每一个像素。这就像用大锤砸坚果。论文指出,即使是最好的现有工具,运行速度也仅为每秒约 10 帧(FPS),这对于实时应用来说太慢了。
2. 解决方案:两个智能工具
YOSE 为现有的 AI 添加了两个特殊的“小工具”,在保持质量的同时提升速度。
小工具 A:“智能裁剪器”(批量变长索引)
- 类比:想象你有一叠 100 份作业,但只有 5 份有错误。普通老师会逐一批改所有 100 份作业。而 YOSE 则像一位老师,能瞬间挑出那 5 份有错误的作业,只批改这些,然后再将它们放回堆中。
- 工作原理:AI 查看“掩码”(即你想要更改的区域)。它使用一种称为BVI的技术,物理上仅选择该掩码内的数据点(令牌)。在繁重的处理过程中,它忽略视频的其余部分。这使得计算机能够根据物体大小处理可变数量的项目,而不是固定且庞大的数量。
小工具 B:“幽灵低语者”(扩散过程模拟器)
- 类比:如果你只涂抹行人曾经所在的那一小块区域,新涂的颜色可能会像贴纸一样,与周围街道的光照或纹理不匹配。你需要知道街道其余部分的样子,才能将新涂的部分融合进去。
- 问题:如果你剪掉“坏”的部分以节省时间,AI 就会忘记“好”部分的样子。它会丢失上下文。
- 修复:YOSE 使用一个名为DiffSim的模块。它并不实际处理视频中“好”的部分(那会很慢),而是创建这些好部分行为的模拟或“幽灵”。它向 AI 低语:“嘿,这里的天空是蓝色的,那边的车正在向左移动”,这样 AI 就知道如何将新补丁无缝融合。这就像你只穿过一个街区,却拥有整个城市的地图。
3. “无缝缝合”(融合策略)
即使有了“幽灵低语者”,新旧视频交接处仍可能出现一条微小的可见线条。YOSE 使用了一个最终技巧:它轻微重叠边缘,并调整亮度和颜色统计量(均值和方差),使过渡变得不可见。这就像对照片剪切的边缘进行羽化处理,使其融入背景。
结果:快速且干净
论文声称,通过使用这些技巧:
- 速度:YOSE 比之前的最佳方法快2.5 倍。如果旧方法需要 10 秒,YOSE 大约只需 4 秒。
- 可扩展性:速度取决于你要移除的物体的大小。如果你移除一个微小的斑点,速度极快。如果你移除一座巨大的建筑物,速度会变慢,但绝不会比旧方法更慢。
- 质量:视频质量与缓慢的全处理方法一样好。事实上,由于它不会意外搞乱背景(因为它忽略了背景),背景往往看起来更稳定。
总结
YOSE 是一个“智能编辑器”,它意识到你不需要为了移除单个物体而重新模拟整个宇宙。它剔除不需要做的工作,利用巧妙的模拟来记住被忽略部分的上下文,并将所有内容完美地缝合在一起,以至于你无法分辨出差异。它将一个缓慢、沉重的过程转变为一个快速、精准的外科手术式过程。
以下是论文《YOSE:仅选择关键 Token 以实现基于 DiT 的高效视频对象移除》的详细技术总结。
1. 问题陈述
视频对象移除(VOR) 旨在从视频中擦除不需要的对象,同时保持空间真实感和时间一致性。最近的先进(SOTA)方法,如 MiniMax Remover,利用 扩散 Transformer(DiT) 实现了高质量结果。然而,这些方法存在显著的 推理延迟 和计算低效问题。
- 核心问题: 现有的基于 DiT 的 VOR 模型在整个时空 Token 空间(所有帧和像素)上执行 密集计算,即使只有被掩码的小区域需要处理。
- 后果: 无论掩码大小如何,计算复杂度保持恒定。由于现实世界的 VOR 任务通常涉及较小的掩码比例(例如,约 70% 的案例掩码小于 20%),这导致了巨大的冗余。例如,MiniMax Remover 的运行速度仅为约 10 FPS,限制了其实际应用。
2. 方法论:YOSE 框架
作者提出了 YOSE(You Only Select Essential Tokens,仅选择关键 Token),这是一个轻量级的即插即用微调框架,旨在加速基于 DiT 的 VOR,而无需重构底层模型。YOSE 引入了两个核心组件:
A. 批可变长度索引(BVI)
BVI 是一种可微的动态索引算子,使模型能够仅处理 掩码区域内的 Token(关键 Token)。
- 机制: 硬索引会阻断梯度流动,而 BVI 使用基于连续插值的选择(通过
grid_sample)将掩码 Token 映射到可变长度序列。
- 前向索引(IndF): 从掩码区域中选择关键 Token 进行处理。
- 后向索引(IndB): 将处理后的结果恢复至其原始的时空位置。
- 优势: 它支持跨批次的 可变长度 Token 处理,使模型能够高效处理不同大小的掩码,同时保持端到端训练的梯度流动。这将计算复杂度从 O(Ntotal) 降低至 O(Nmasked)。
B. 扩散过程模拟器(DiffSim)模块
仅处理掩码 Token 可能会破坏与未掩码(背景)区域的语义连续性。DiffSim 通过模拟未掩码区域的影响(而无需处理它们)来解决这一问题。
- 机制:
- 构建一个 残差潜变量(ResNis),表示噪声潜变量与掩码视频潜变量之间的差异。
- 使用可学习参数为未掩码区域生成 代理 Key 和 Value(KV) 特征:包括组合参数(G)、缩放参数(S)和偏置($Bias$)。
- 模拟 KV 的公式为:KV=G⋅Latmask+(1−G)⋅ResNis,随后进行缩放和偏置调制。
- 优势: 这些模拟特征被注入到 DiT 的自注意力机制中。这使得“内部”(掩码)Token 能够关注“外部”(未掩码)上下文,从而在不进行全 Token 计算的情况下,保持跨边界的 语义和时间一致性。
C. 融合策略
为了消除由处理区域与未处理区域之间的统计不匹配引起的边界伪影:
- 对掩码进行膨胀以创建重叠区域。
- 将生成的重叠区域的均值和方差与原始未掩码区域对齐。
- 应用加权混合策略以确保平滑过渡。
3. 主要贡献
- YOSE 框架: 一种掩码感知的微调框架,通过仅处理关键 Token 来加速基于 DiT 的 VOR(如 MiniMax Remover),实现了相对于掩码比例的线性计算复杂度。
- 批可变长度索引(BVI): 一种可微算子,实现了高效的可变长度 Token 选择和处理,解决了动态掩码相关的梯度流动和批并行化问题。
- 扩散过程模拟器(DiffSim): 一种新颖模块,在 DiT 块内近似未掩码区域的扩散影响,确保全局语义一致性,同时避免冗余计算。
- 性能: 该方法实现了高达 2.5 倍 的加速(在 20% 掩码比例下达到约 25 FPS),同时保持了与基线相当或略优的视觉质量。
4. 实验结果
作者在 DAVIS 和 YouTube-VOS 数据集上对 MiniMax Remover 和 VACE 评估了 YOSE。
- 速度与效率:
- FLOPs 与延迟: YOSE 表现出推理时间与掩码比例之间的线性关系。
- 加速比: 在 5% 掩码比例下实现 3.3 倍 加速,在 20% 掩码比例(典型的现实场景)下实现 2.5 倍 加速。
- FPS: 在 480p 分辨率下,帧率从 MiniMax 的约 10 FPS 提升至 约 25 FPS(YOSE)。
- 视觉质量:
- 指标: YOSE 在 VBench 指标(运动平滑度、美学质量)和背景指标(PSNR、SSIM、LPIPS)上保持了相当或略有提升的分数。
- 背景保留: 值得注意的是,与原始 VACE 相比,YOSE(VACE)将背景 PSNR 提高了 5.47 dB,SSIM 提高了 0.07,有效防止了背景中出现掩码形状的伪影“幻觉”。
- 消融研究:
- 移除 DiffSim 会导致运动平滑度和背景重建质量下降。
- 移除 融合策略 会导致可见的边界伪影。
- 训练效率: 与常规方法约 11 小时相比,BVI 使得在 8 张 GPU 上以 4 的批量大小进行训练仅需约 4 小时。
5. 意义
YOSE 代表了迈向 实用、实时视频编辑 的重要一步。通过将计算成本与视频总大小解耦,并将其严格绑定到感兴趣区域(掩码),它解决了当前基于 DiT 的生成式视频模型的主要瓶颈。
- 可扩展性: 它使得在消费级硬件上或在延迟至关重要的实时应用中实现高保真视频对象移除成为可能。
- 通用性: 该框架与模型无关(即插即用),并已在多种基于 DiT 的架构(MiniMax Remover、VACE)上成功验证。
- 质量与速度: 它证明了激进的加速并不一定需要以视觉保真度为代价;在某些情况下,选择性处理甚至通过防止模型过度解释未掩码区域,提高了背景的稳定性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。