← 最新论文
💻 computer science

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE 是一种基于 DiT 的视频物体移除高效微调框架,它通过批量变长索引自适应地选择关键令牌,并利用扩散过程模拟器模拟未掩码区域,在保持视觉质量的同时实现了高达 2.5 倍的推理加速。

原作者: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一段繁忙街道的视频,想要移除画面中正在走过的一名特定行人。过去,试图完成这一任务的 AI 模型就像一群画家:他们不是仅仅涂改那个人,而是每次做出更改时,都要重新绘制整条街道、天空以及背景中的每一辆车。这极其缓慢且浪费,因为 90% 的视频内容根本无需触碰。

本文介绍了YOSE(You Only Select Essential Tokens,仅选择必要令牌),这是一种新方法,它像一个智能的外科手术式编辑器。YOSE 不会重绘整个画布,而只修复需要修正的特定区域,同时确保新绘制的部分与未触碰的部分完美融合。

以下是 YOSE 的工作原理,分解为简单概念:

1. 问题:“整块画布”方法

当前的 AI 视频工具(基于一种称为"DiT"的技术)在移除物体方面表现很好,但速度很慢。即使你只想从视频中移除一只小鸟,计算机也会处理整段视频的每一个像素。这就像用大锤砸坚果。论文指出,即使是最好的现有工具,运行速度也仅为每秒约 10 帧(FPS),这对于实时应用来说太慢了。

2. 解决方案:两个智能工具

YOSE 为现有的 AI 添加了两个特殊的“小工具”,在保持质量的同时提升速度。

小工具 A:“智能裁剪器”(批量变长索引)

  • 类比:想象你有一叠 100 份作业,但只有 5 份有错误。普通老师会逐一批改所有 100 份作业。而 YOSE 则像一位老师,能瞬间挑出那 5 份有错误的作业,只批改这些,然后再将它们放回堆中。
  • 工作原理:AI 查看“掩码”(即你想要更改的区域)。它使用一种称为BVI的技术,物理上仅选择该掩码内的数据点(令牌)。在繁重的处理过程中,它忽略视频的其余部分。这使得计算机能够根据物体大小处理可变数量的项目,而不是固定且庞大的数量。

小工具 B:“幽灵低语者”(扩散过程模拟器)

  • 类比:如果你只涂抹行人曾经所在的那一小块区域,新涂的颜色可能会像贴纸一样,与周围街道的光照或纹理不匹配。你需要知道街道其余部分的样子,才能将新涂的部分融合进去。
  • 问题:如果你剪掉“坏”的部分以节省时间,AI 就会忘记“好”部分的样子。它会丢失上下文。
  • 修复:YOSE 使用一个名为DiffSim的模块。它并不实际处理视频中“好”的部分(那会很慢),而是创建这些好部分行为的模拟或“幽灵”。它向 AI 低语:“嘿,这里的天空是蓝色的,那边的车正在向左移动”,这样 AI 就知道如何将新补丁无缝融合。这就像你只穿过一个街区,却拥有整个城市的地图。

3. “无缝缝合”(融合策略)

即使有了“幽灵低语者”,新旧视频交接处仍可能出现一条微小的可见线条。YOSE 使用了一个最终技巧:它轻微重叠边缘,并调整亮度和颜色统计量(均值和方差),使过渡变得不可见。这就像对照片剪切的边缘进行羽化处理,使其融入背景。

结果:快速且干净

论文声称,通过使用这些技巧:

  • 速度:YOSE 比之前的最佳方法快2.5 倍。如果旧方法需要 10 秒,YOSE 大约只需 4 秒。
  • 可扩展性:速度取决于你要移除的物体的大小。如果你移除一个微小的斑点,速度极快。如果你移除一座巨大的建筑物,速度会变慢,但绝不会比旧方法更慢。
  • 质量:视频质量与缓慢的全处理方法一样好。事实上,由于它不会意外搞乱背景(因为它忽略了背景),背景往往看起来稳定。

总结

YOSE 是一个“智能编辑器”,它意识到你不需要为了移除单个物体而重新模拟整个宇宙。它剔除不需要做的工作,利用巧妙的模拟来记住被忽略部分的上下文,并将所有内容完美地缝合在一起,以至于你无法分辨出差异。它将一个缓慢、沉重的过程转变为一个快速、精准的外科手术式过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →