← 最新论文
💻 computer science

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

本文介绍了 SegFS,这是一个用于实时开放词汇视频实例分割的双流快慢框架,它通过将稀疏关键帧上的多模态语义理解与后续帧中用于密集掩码预测的高效特征空间调节进行解耦,实现了比面向移动端的模型低至 14 倍的延迟。

原作者: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正尝试用智能手机拍摄一段繁忙的街道场景,你希望你的手机能瞬间为每一个移动的汽车、狗和人画出完美的轮廓,甚至当你要求它寻找它从未见过的东西(比如“一辆紫色的踏板车”)时也是如此。这被称为开放词汇视频实例分割(Open-Vocabulary Video Instance Segmentation)

问题在于,要实现如此高的准确度通常需要一台超级计算机。试图在手机上运行这样一个沉重的“大脑”,会导致视频卡顿、掉帧或冻结。

这篇论文介绍了一种名为 SegFS(快慢分割,Segmenting, Fast and Slow) 的新系统,它通过使用一种**“快慢结合”的团队协作方式**解决了这个问题。以下是它的工作原理,我将使用简单的类比来解释:

1. 问题所在:“沉重大脑”的瓶颈

目前的各种高科技视频系统就像一位主厨,在端上每一份汤之前都要先品尝每一种食材。

  • 主厨(慢速路径): 这是沉重且准确的部分,即 AI。它观察视频,阅读你的文本提示(例如,“找到那只狗”),并仔细判断那只狗的具体样子以及它所在的位置。
  • 瓶颈: 这位主厨极其缓慢。如果你要求他们每秒钟品尝 30 次视频中的每一帧,手机会过热,视频也会停止播放。

2. 解决方案:“快慢结合”的团队

与其要求主厨品尝每一帧,不如将工作分配给两个角色:

慢速路径:主厨(关键帧)

  • 职责: 这个重型 AI 每隔几秒钟才看一次一帧画面(即“关键帧”)。
  • 任务: 它负责处理繁重的工作。它识别物体,读取文本提示,并为它发现的每个物体创建一个详细的“身份证”(嵌入向量/embedding)。它会说:“好的,就在这一刻,这里有一只狗,那里有一只猫。”
  • 类比: 想象一下拍一张高质量的照片,并为场景中的每个人写下一份详细的描述。

快速路径:速写画家(帧间)

  • 职责: 这个轻量级的 AI 会观察关键帧之间每一帧的画面。
  • 任务: 它不需要再次进行“思考”或“阅读”文本。相反,它获取主厨创建的“身份证”,并将其作为指南。它观察视频的原始像素,然后问道:“根据主厨的笔记,那只狗现在在哪里?”
  • 技巧: 快速路径非常聪明。它知道图像的基本“骨架”(形状和边缘)已经存在于视频数据中了。它只需要根据主厨的指令将轮廓“涂抹”出来即可。
  • 类比: 想象主厨画了一张狗所在位置的地图。速写画家只需在接下来的几秒钟内,根据这张地图快速描绘出狗的移动轨迹。速写画家的速度非常快,比主厨品尝汤的速度快 14 倍。

3. 他们如何沟通

论文描述了一个特殊的“注入”过程。

  • 当主厨(慢速路径)发现一只狗时,它发送的不只是一张图片,而是一个数字指纹
  • 速写画家(快速路径)接过这个指纹,并将其直接“注入”到原始视频数据中。
  • 这使得速写画家能够瞬间明白:“啊,这个向左移动的模糊形状就是主厨识别出的那只狗。”它不需要从头开始重新识别这只狗,而只是在追踪这个指纹。

4. 结果:速度与质量并存

论文在一部三星 Galaxy S25 Ultra(一款性能非常强大的手机)上进行了测试。

  • 速度: 该系统比之前的移动端友好模型快了 14 倍。它可以以 30 帧每秒 的速度处理视频,这是实现流畅实时视频的标准速度。
  • 准确度: 尽管速度极快,但其准确度几乎可以媲美那些缓慢且沉重的模型。“速写画家”很少出错,因为它始终受到“主厨”详细笔记的引导。
  • 效率: 由于沉重的“品尝”(复杂计算)只是偶尔发生,而“速写”(轻量计算)则持续进行,因此该系统节省了大量的电池和计算资源。

总结

可以将 SegFS 想象成一位指挥家和一支管弦乐队

  • **指挥家(慢速路径)**每隔几秒站在指挥台上,观察乐谱,并告诉管弦乐队该演奏什么。
  • **管弦乐队(快速路径)**持续演奏音乐,遵循指挥家的最后指令,同时根据当下的节奏进行即时调整。

通过将“思考”(慢速)与“执行”(快速)分离,该系统实现了在手机上进行实时的视频理解,而无需依赖超级计算机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →