← 最新论文
💻 computer science

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)

本文提出了一种结合了 Segment Anything Model 3 (SAM3) 零样本能力与微调视觉语言模型的两阶段、无标注框架,以实现实例级手术器械分割,尽管其表现仍不及全监督方法,但证明了其相对于直接使用文本提示的 SAM3 应用具有显著改进。

原作者: Nakul Poudel, Richard Simon, Cristian A. Linte

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Nakul Poudel, Richard Simon, Cristian A. Linte

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人进行手术。为了做到这一点,机器人需要准确知道手术器械在视频画面中的位置,并能将一把剪刀与一块组织或一个阴影区分开来。这被称为“手术器械分割”。长期以来,教机器人掌握这项技能的唯一方法是聘请专家,在成千上万小时的视频中,对每一个工具进行逐像素的轮廓描绘。这就像试图通过向一个孩子展示一百万张照片,并由人费力地为每一只狗的毛发涂上颜色,来教这个孩子识别狗。这种方法有效,但速度慢、成本高且难以规模化。

最近,一种名为“分割一切模型”(Segment Anything Model,简称 SAM)的新型人工智能出现了。你可以把 SAM 想象成一个超级强大的荧光笔,只要你指一下,或者给出一个简单的文本指令如“工具”,它就能瞬间为图片中的任何物体涂上颜色。它是在数百万张日常照片上训练出来的,因此非常擅长寻找现实世界中的事物。然而,当研究人员尝试将这种荧光笔用于奇特、闪亮且混乱的体内手术视频世界时,它却感到困惑了。机器人并不理解,手术视频中的“抓钳”或“剪刀”与厨房照片中的物体是同一种东西。机器人的训练内容与手术现实之间的差距太大了,仅仅大声喊出工具的名字是行不通的。

Nakul Poudel 及其同事的这篇论文解决了这个确切的问题。他们想看看是否可以让机器人无需任何人工绘制的轮廓(掩码)或手动点击,就能发现并识别手术工具。他们并没有仅仅尝试让机器人理解特定的工具名称,而是构建了一个由两步组成的“侦探团队”。首先,他们使用了一个改进版的荧光笔(称为 SAM3)配合一个非常简单、通用的指令:“工具”。这成功地找到了工具的“形状”,即使它还不知道这些工具的名字。接着,他们将这些形状传递给第二个人工智能——一个被称为 Qwen 的“大脑”,这个大脑被教导去观察这些被高亮显示的形状,并猜测它是什么种类的工具。

研究结果呈现出一种“尚未完美,但非常有前景”的状态。该团队发现,虽然他们这种新的两步法并没有超越那些经过数千个手工绘制轮廓训练的最强机器人,但相比于直接使用工具名称来驱动荧光笔,这已经是一个巨大的进步。事实上,直接使用的方法经常完全失败,要么漏掉工具,要么把名字搞错。新方法成功识别了许多案例中的工具,证明了你可以让机器人“看到”手术工具,而无需承担繁重的人工绘图负担。然而,作者也谨慎地指出,该系统仍然会犯错,尤其是在工具被遮挡或荧光笔画出的形状很凌乱的情况下。他们认为,虽然这并不是一个能解决今天所有问题的魔法方案,但它开启了一扇大门,通向一个手术机器人可以学习得更快、更便宜的未来,而不再需要成群结队的专业人员去绘制每一张图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →