← 最新论文
💻 computer science

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

本文介绍了 SAM+D,这是一个参数高效的框架,通过集成深度路由 LoRA(Depth-Routed LoRA)和深度偏移模块(Depth Shift Modules),将 2D SAM 系列模型适配到 3D 和 4D 体素分割任务中,在保持预训练权重的同时,以极少的训练参数实现了具有竞争力的性能。

原作者: Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何观察世界。多年来,最优秀的机器人都是观察二维平面图像的专家,比如一张猫的照片或一张城市地图。它们在这方面极其出色,经过了数十亿张图像的训练,能够瞬间识别形状和边界。但现实世界并非平面的;它是深邃的。它拥有厚度、层次以及流逝的时间。当医生观察人体 3D 扫描图像,或生物学家在显微镜下观察细胞随时间移动时,他们看到的不仅仅是单张平面照片,而是一个体积(volume),即一系列图像的堆叠。

问题在于,这些处理平面图像的专家在面对 3D 物体时会感到困惑。如果你要求一个仅接受过照片训练的机器人去理解一个 3D 肿瘤,它可能会尝试逐一查看肿瘤的每一层切片,就像是在翻阅一本书,却没意识到这些页面是相互连接的。它错失了物体在空间中存在的整体全貌。为了解决这个问题,科学家通常不得不从头开始构建全新的、庞大的机器人系统,这需要耗费大量的资源和计算能力。但如果我们能直接给现有的“平面图像专家”戴上一副 3D 眼镜,并进行少量的训练,而不需要重构它的整个大脑呢?这正是这篇论文试图解决的核心问题:我们如何利用一个已经掌握 2D 能力的模型,在不从零开始的前提下,教会它理解 3D(甚至是包含时间维度的 4D)?


由此,SAM+D 应运而生——这是一个聪明的框架,充当了这些“平面”视觉模型的神奇适配器。作者 Yu Song 及其团队希望将著名的 Segment Anything Model (SAM) 及其具备视频处理能力的近亲 SAM2 提升一个维度。可以将 SAM 想象成一位大师级的画家,他可以完美地勾勒出一张照片中猫的轮廓。而 SAM+D 则是一个工具,它能让这位画家在无需重新学习如何握笔的情况下,突然开始绘制一只猫的 3D 雕塑,甚至是一部猫在奔跑的电影。

SAM+D 的秘诀在于它并不触动模型沉重的、预训练好的“大脑”。相反,它在模型思考过程的每一个层级中,都巧妙地嵌入了两个轻量级的“小装置”。这些装置非常微小,以至于团队在训练 3D 版本时仅需训练约 2.8% 的参数,而在 4D 版本中也仅需 3.7%。这就像是通过添加两个小型涡轮增压器来升级汽车引擎,而不是更换整个引擎。

第一个装置被称为深度路由 LoRA (DRLoRA)。想象你正在看一条面包。顶层切片的表皮与中间柔软的部分不同,底层的表皮又与中间不同。标准的 AI 可能会试图以同样的方式对待每一层切片。而 DRLoRA 则像是一位聪明的向导,准确知道你正在看哪一层。它拥有一组微型专家(称为“LoRA 专家”)和一个路由器,该路由器会说:“嘿,我们现在看的是表皮,所以由专家 A 来处理,”或者“我们现在处于中间部分,所以专家 B 接管。”这使得模型能够根据切片的深度调整其理解能力,捕捉不同部分的独特特征。

第二个装置是深度偏移模块 (DSM)。这个装置更酷的地方在于,它完全不会增加额外的计算开销。想象一排人正在传递纸条。通常情况下,人 1 只能和人 2 说话,人 2 只能和人 3 说话。但在 3D 体积中,上层切片和下层切片也是邻居。DSM 扮演了一个“神奇耳语者”的角色,它让一个切片在进行自身思考之前,能够从上方和下方的切片中“借用”一些特征。它会在切片之间横向转移一小部分信息。这一过程是瞬时完成的,无需额外的数学计算,从而让模型理解物体在切片之间是平滑延续的。

团队在两个截然不同的领域测试了这种神奇的适配器。首先,他们将其应用于医学 CT 扫描(人体器官如肾脏、胰腺、肝脏和结肠的 3D 图像)。他们只需给模型一个点(即“点提示”)来表示“从这里开始”,SAM+D 就能成功勾勒出整个 3D 器官的轮廓。它的表现媲美甚至优于那些需要更多训练和数据的其他方法,同时消耗的计算能力却极小。

其次,他们将其带入了微观世界的细胞追踪(4D,即 3D 空间加时间)。在这里,他们观察细胞如何随时间进行分裂和移动。通过在 SAM2(视频版本)上使用相同的适配器,他们可以追踪细胞在时空中的变化,处理细胞分裂以及新细胞出现的情况,而这一切都只需通过同一个点提示即可实现。结果表明,该模型在追踪细胞方面的表现,远优于仅仅逐帧观察模型。

论文非常明确地说明了它并未做到的事情。它并不声称自己是针对所有可能 3D 任务的完美通用解决方案,并且指出它尚未在最新的“文本提示”版本(SAM3)上进行测试。然而,研究结果是扎实的:通过使用这两个轻量级模块,团队成功地将 2D 模型提升到了 3D 和 4D 维度,证明了你不需要丢弃原有的聪明模型,也能理解这个深邃且运动的世界。你只需要给它们戴上合适的眼镜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →