✨ 要点🔬 技术摘要
想象一下,你正尝试用智能手机拍摄一段繁忙的街道场景,你希望你的手机能瞬间为每一个移动的汽车、狗和人画出完美的轮廓,甚至当你要求它寻找它从未见过的东西(比如“一辆紫色的踏板车”)时也是如此。这被称为开放词汇视频实例分割(Open-Vocabulary Video Instance Segmentation) 。
问题在于,要实现如此高的准确度通常需要一台超级计算机。试图在手机上运行这样一个沉重的“大脑”,会导致视频卡顿、掉帧或冻结。
这篇论文介绍了一种名为 SegFS(快慢分割,Segmenting, Fast and Slow) 的新系统,它通过使用一种**“快慢结合”的团队协作方式**解决了这个问题。以下是它的工作原理,我将使用简单的类比来解释:
1. 问题所在:“沉重大脑”的瓶颈
目前的各种高科技视频系统就像一位主厨 ,在端上每一份汤之前都要先品尝每一种食材。
主厨(慢速路径): 这是沉重且准确的部分,即 AI。它观察视频,阅读你的文本提示(例如,“找到那只狗”),并仔细判断那只狗的具体样子以及它所在的位置。
瓶颈: 这位主厨极其缓慢。如果你要求他们每秒钟品尝 30 次视频中的每一帧,手机会过热,视频也会停止播放。
2. 解决方案:“快慢结合”的团队
与其要求主厨品尝每一帧,不如将工作分配给两个角色:
慢速路径:主厨(关键帧)
职责: 这个重型 AI 每隔几秒钟才看一次一帧画面 (即“关键帧”)。
任务: 它负责处理繁重的工作。它识别物体,读取文本提示,并为它发现的每个物体创建一个详细的“身份证”(嵌入向量/embedding)。它会说:“好的,就在这一刻,这里有一只狗,那里有一只猫。”
类比: 想象一下拍一张高质量的照片,并为场景中的每个人写下一份详细的描述。
快速路径:速写画家(帧间)
职责: 这个轻量级的 AI 会观察关键帧之间每一帧 的画面。
任务: 它不需要再次进行“思考”或“阅读”文本。相反,它获取主厨创建的“身份证”,并将其作为指南。它观察视频的原始像素,然后问道:“根据主厨的笔记,那只狗现在在哪里?”
技巧: 快速路径非常聪明。它知道图像的基本“骨架”(形状和边缘)已经存在于视频数据中了。它只需要根据主厨的指令将轮廓“涂抹”出来即可。
类比: 想象主厨画了一张狗所在位置的地图。速写画家只需在接下来的几秒钟内,根据这张地图快速描绘出狗的移动轨迹。速写画家的速度非常快,比主厨品尝汤的速度快 14 倍。
3. 他们如何沟通
论文描述了一个特殊的“注入”过程。
当主厨(慢速路径)发现一只狗时,它发送的不只是一张图片,而是一个数字指纹 。
速写画家(快速路径)接过这个指纹,并将其直接“注入”到原始视频数据中。
这使得速写画家能够瞬间明白:“啊,这个向左移动的模糊形状就是主厨识别出的那只狗。”它不需要从头开始重新识别这只狗,而只是在追踪这个指纹。
4. 结果:速度与质量并存
论文在一部三星 Galaxy S25 Ultra(一款性能非常强大的手机)上进行了测试。
速度: 该系统比之前的移动端友好模型快了 14 倍 。它可以以 30 帧每秒 的速度处理视频,这是实现流畅实时视频的标准速度。
准确度: 尽管速度极快,但其准确度几乎可以媲美那些缓慢且沉重的模型。“速写画家”很少出错,因为它始终受到“主厨”详细笔记的引导。
效率: 由于沉重的“品尝”(复杂计算)只是偶尔发生,而“速写”(轻量计算)则持续进行,因此该系统节省了大量的电池和计算资源。
总结
可以将 SegFS 想象成一位指挥家和一支管弦乐队 。
**指挥家(慢速路径)**每隔几秒站在指挥台上,观察乐谱,并告诉管弦乐队该演奏什么。
**管弦乐队(快速路径)**持续演奏音乐,遵循指挥家的最后指令,同时根据当下的节奏进行即时调整。
通过将“思考”(慢速)与“执行”(快速)分离,该系统实现了在手机上进行实时的视频理解,而无需依赖超级计算机。
技术摘要:SegFS —— 基于双路径处理的实时开放词汇视频实例分割
1. 问题陈述
开放词汇视频实例分割(OV-VIS)旨在根据任意文本提示,在视频帧中识别、跟踪并分割物体实例。虽然近期的以物体为中心的模型(如 GLEE、MOBIUS)已取得了高精度,但它们面临着严重的计算开销问题,尤其是在**特征增强器(feature enhancer)和 物体解码器(object decoder)**组件中。这些组件占据了主要的推理成本,使得在移动端硬件(如智能手机)上进行实时、设备端部署变得难以实现。现有的优化模型尝试虽多,但仍无法在不显著降低精度的情况下满足高帧率(如 30 FPS)的要求。核心挑战在于如何将计算昂贵的多模态语义理解与用于时间传播(temporal propagation)的密集逐帧掩码预测解耦。
2. 方法论:SegFS 框架
作者提出了 SegFS ,这是一个双流“快慢”框架,旨在通过在不同时间频率下运行两个不同的路径来摊销计算成本。
双路径架构
慢速路径(关键帧): 仅在稀疏采样的关键帧(例如每 T T T 帧)上运行。它利用标准的、沉重的以物体为中心的 OV-VIS 模型(如 MOBUS、GLEE 或 TROY-VIS)来进行完整的多模态融合和物体解码。该路径提取高质量、与文本对齐的物体嵌入(object embeddings) (即实例表示)。
快速路径(中间帧): 在关键帧之间的每一帧上运行。它完全绕过了昂贵的特征增强器和物体解码器。相反,它依赖于一个轻量级的快速特征聚合器(Fast Feature Aggregator) ,该聚合器利用从慢速路径传播而来的物体嵌入来调节视觉骨干网络的特征图。
核心机制
投影至快速特征空间: 由慢速路径解码的物体嵌入被投影到骨干网络的特征空间中。一个前馈网络(FFN)根据文本相似度选择前 K K K 个嵌入,并附加一个可学习的背景标记(background token)。
物体引导模块: 在最低分辨率的骨干网络特征图(P 5 P_5 P 5 )上,将选定的物体嵌入进行空间注入。其实现方式包括:
物体注入(Object Injection): 计算 P 5 P_5 P 5 的空间单元与物体标记之间的余弦相似度,以创建物体感知的特征图。
门控融合(Gated Fusion): 一种门控机制将注入的物体语义与原始骨干网络特征进行融合,在引入实例语义的同时保留精确的视觉线索。
渐进式上采样: 经过增强的 P 5 P_5 P 5 图通过轻量级的深度可分离卷积块(DSConvGN)进行渐进式上采样,并与更高分辨率的骨干网络特征(P 4 , P 3 , P 2 P_4, P_3, P_2 P 4 , P 3 , P 2 )进行融合。
掩码预测: 最终的高分辨率特征图通过与物体嵌入(作为卷积核)进行卷积,生成掩码逻辑值(mask logits)。
时间关联: 该框架采用了标准的“通过匹配进行跟踪”(tracking-by-matching)范式(MinVIS),通过物体嵌入的余弦相似度在帧间关联物体查询(queries),避免了显式的光流估计。
训练策略
SegFS 在图像级实例分割数据集(COCO、LVIS、RefCOCO 等)上进行训练,并将其视为视频数据集,但在训练期间忽略时间连续性。
混合匹配: 在训练期间,慢速网络处理图像以生成准确的类别逻辑值和边界框。这些信息被用于建立与地面真值(ground truth)之间的最优二分匹配(匈牙利算法)。
监督: 快速网络使用基于此匹配得到的掩码预测进行监督,利用 Mask Loss 和 DICE Loss。这使得快速网络能够学习如何重现慢速网络的分割质量,而无需运行慢速网络的沉重组件。
3. 核心贡献
双路径范式扩展: 作者将基于关键帧的方法扩展到了 OV-VIS 领域,证明了骨干网络特征本身就包含了足够的空间细节用于定位。因此,沉重的特征增强器可以被限制在稀疏的关键帧上,而不会造成明显的精度损失。
新型快速特征聚合器: 一个轻量级模块,可将物体嵌入注入到骨干网络特征金字塔中,从而以极低的延迟实现精确的掩码生成。
效率与精度的权衡: 该框架成功地将语义理解与密集预测解耦,在保持竞争力的分割性能的同时实现了实时速度。
4. 实验结果
作者在标准的 OV-VIS 基准测试集 YouTubeVIS19 、OVIS 、BURST 和 LV-VIS 上对 SegFS 进行了评估。
性能对比基准:
SegFS 的性能与“复用物体”(Reuse Objects)基准(即运行完整的慢速网络但跳过解码器)相当,并且显著优于基于光流传播的方法(如 RAFT、LiteFlowNet2)以及双网络竞争对手 MPVSS。
在 MOBIUS-Mini-M 骨干网络下,SegFS 在 YouTubeVIS19 上的 AP 达到 41.6 ,仅略低于完整慢速网络的 42.1,但大幅降低了延迟。
效率与延迟:
加速效果: 与面向移动端的 MOBIUS 模型相比,SegFS 实现了高达 14 倍的延迟降低 。
实时能力: 在三星 Galaxy S25 Ultra 上,SegFS 跨越了 30 FPS 的阈值(在 6 帧跨度内实现约 38 FPS 的平均 FPS),而基准模型往往难以超过 10–16 FPS。
硬件测试: 该方法在各种移动芯片(Snapdragon 8 Elite, Gen 5, X2, XR2)和 GPU(A100, T4)上进行了测试,一致显示出卓越的边缘侧延迟表现。
消融实验:
传播间隔(T T T ): 随着关键帧间隔的增加(最高达 T = 10 T=10 T = 10 ),SegFS 仍能保持稳健的性能,优于会迅速退化的掩码变形(mask-warping)方法。
组件影响: “物体注入”和“基于注意力的细化”模块被认为是弥合快速路径与完整慢速网络之间性能差距的最关键组件。
5. 重要性与主张
论文声称 SegFS 树立了实时、设备端 OV-VIS 的新标准 。通过将实例传播的计算负担从物体解码转移到特征空间调节,该框架有效地绕过了当前最先进模型中最昂贵的组件。
作者强调,其方法:
保留了零样本(Zero-Shot)能力: 它保留了底层慢速模型的开放词汇特性。
支持移动端部署: 它是首个能在现代移动硬件上稳定实现 >30 FPS 且不牺牲掩码质量的 OV-VIS 方法。
解耦语义与几何: 它证明了只要将实例嵌入正确地投影到视觉骨干网络的特征空间中,就不需要为每一帧都重新计算高层语义理解。
研究结论指出,对于 OV-VIS 而言,沉重的特征增强器在中间帧是冗余的,通过将骨干网络特征与投影后的嵌入进行轻量级融合,便足以实现高质量、实时的分割。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。