← 最新论文
💻 computer science

RS3^3-Prune: Read-Sparse, Store-Sparse Token Pruning for Video Object Segmentation

RS3^3-Prune 是一种用于视频目标分割的无需训练的令牌剪枝方法,它通过将跨帧注意力查询和记忆库条目选择性地限制在几何相关令牌上,从而降低推理延迟和峰值内存使用量,进而实现在不牺牲准确性的情况下,在内存受限的硬件上高效处理长视频。

原作者: Avilasha Mandal, Sarvesh Shashikumar

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Avilasha Mandal, Sarvesh Shashikumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,有一种任务叫做视频目标分割(video object segmentation)。想象一下,你正在观看一段家庭录像,并要求计算机在每一帧画面中,为一只奔跑中的狗画出完美的轮廓,将其与背景中的草地、天空以及人群区分开来。长期以来,执行这项任务的最佳计算机程序通过记忆它所看到的一切来工作。随着视频的播放,软件会构建一个庞大的、不断增长的视觉细节库,为每一帧中的每一个像素存储一小块信息。这个库让计算机即使在狗跑到树后或改变方向时,也能识别出这只狗。然而,这种方法有一个严重的缺陷:视频越长,库就变得越大。最终,计算机会耗尽内存,导致其停止运行或变得极其缓慢。这使得在长篇电影或存储空间有限的小型设备(如智能手机)上使用这些先进系统变得几乎不可能。

一组研究人员发现了一种方法,可以在不降低计算机准确性的情况下打破这一瓶颈。他们开发了一种新方法,改变了软件决定记住什么以及忽略什么的方式。该系统不再囤积来自每一帧的所有细节,而是像一位细心的档案管理员一样,只保留最核心的文件。通过应用两个特定的过滤器——一个决定当前时刻应该关注什么,另一个决定稍后应该保存什么——研究人员能够大幅缩小计算机所需的内存量。他们的工作表明,视频分割系统可以运行得更快,且使用的内存更少,同时仍能以与原始未修改系统相同的高精度追踪目标。

研究人员 Avilasha Mandal 和 Sarvesh Shashikumar 专注于一种被称为“记忆库”(memory-bank)网络的特定类型视频分析系统。这些系统主要分为两个阶段。首先,它们观察一个新的视频帧,并将其分解成一个由微小碎片组成的网格,称为“标记”(tokens),这些标记代表了视觉信息。其次,它们将这些新的碎片与来自先前帧的不断增长的记忆库进行对比,以确定物体的位置。问题在于,现代系统试图将新帧中的每一个标记都与记忆库中的每一个标记进行对比。随着视频变长,这个记忆库会不断膨sa,计算机在处理每一帧时都需要进行海量的数学运算,从而迅速耗尽资源。

为了解决这个问题,该团队引入了一种被称为 RS3-Prune 的技术。这个名字代表“读稀疏、存稀疏”(Read-Sparse, Store-Sparse),描述了他们在两个环节对数据进行了精简。第一个环节发生在计算机读取记忆时。系统不再询问记忆库关于当前图像的所有部分,而是只询问那些可能包含正在追踪的目标的部分。它使用一个基于物体形状的简单规则:如果一个图像块距离物体的已知位置较远,系统就会忽略它。这意味着计算机跳过了大量的无效计算,显著提高了处理速度。

第二个环节发生在计算机将新信息写入其记忆库时。在旧系统中,每一帧都会向记忆库添加一组完整的数据,无论这些数据是否有用。新方法在保存任何内容之前会询问一个不同的问题:“这个图像块属于我们正在追踪的物体吗?”如果答案是否定的,该信息会立即被丢弃,永远不会被存储。这防止了记忆库被天空或墙壁等背景噪声填满,确保即使在数小时的视频播放后,记忆库依然保持精简且易于管理。

研究人员在五个不同的视频数据集(从短片到超长序列)上测试了这种方法,并将其应用于五种不同的尖端视频分割模型。他们发现,这种新方法使系统运行得更快。平均而言,速度提升了近 39%,这意味着计算机每秒可以处理近 40% 更多的帧。与此同时,运行该软件所需的内存量下降了约 13%。或许最令人惊讶的是,追踪的准确性并没有受到影响。事实上,在一些背景杂乱的困难视频中,系统的表现甚至更好,因为它不再会被无关的细节所干扰。

这项发现最重要的方面之一是它不需要重新训练计算机模型。研究人员只是添加了一组小的指令,就像是在现有软件前设置了一个“守门人”。他们不需要教计算机任何新知识,也不需要改变其核心大脑。这使得该解决方案非常容易使用;它可以应用于任何使用记忆库的现代视频分割系统,将一个固定的、昂贵的需求转变为一个可以调节的灵活设置。

团队还探讨了为什么这种方法如此有效。他们意识到,被追踪的物体通常具有独特的形状和纹理,而背景往往是平滑且统一的。通过仅关注那些携带最多视觉能量且位于物体边界内的标记,系统自然地过滤掉了噪声。这类似于一个人看电影时专注于演员,而忽略了电影院里的空座位;计算机也学会了自动做到这一点。

虽然这种方法非常有效,但研究人员也承认它并非适用于所有场景。如果一个物体移动到了远离最初被看到的位置的地方,如果记忆库过于严格,系统可能会难以追踪它。然而,他们构建了一个安全机制,如果物体消失了几帧,系统会扩大搜索范围,以确保能够再次找到它。这种在严格过滤与灵活恢复之间的平衡,使得系统能够处理大多数现实世界的视频,而无需人工干预。

这项工作的意义不仅在于让软件变得更快。通过减少所需的内存和处理能力,这些系统可以应用在原本无法处理它们的设备上。这可以实现智能手机、无人机或穿戴式摄像机上的实时视频分析,为需要长时间追踪物体的应用开启新的可能性。研究人员证明,这些系统的限制不在于算法的智能程度,而在于它们被迫处理的海量数据量。通过智能地修剪这些数据,他们解锁了一个新的效率水平,证明了有时,知道该忘记什么与知道该记住什么同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →