← 最新论文
💻 computer science

Fine-Tuned Foundation Models for Multi-Category Segmentation and Triplet Recognition in Gastric Cancer Surgery

本研究提出了一种微调基础模型的方法,该方法利用一个新策划的包含 2,909 个标注帧的新型数据集,实现了对手术器械与解剖结构的精确语义分割,以及对手术动作三元组的鲁棒识别,从而推进了胃癌手术中的术中引导与自动化技能评估。

原作者: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

发布于 2026-09-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人体内部,胃部是一个由软组织、血管和脆弱器官组成的复杂景观,所有这些都挤在一个狭小的空间内。当外科医生切除癌变的胃部时,他们必须以极高的精准度在这一复杂的环境中进行操作,通常使用通过微小切口插入的长而细的工具。这是一项高风险的任务,哪怕一次轻微的失误都可能导致严重的伤害。几十年来,解决方案完全依赖于外科医生的眼睛和经验,但一门新的科学领域正试图为他们提供一双“数字第二双眼”。该领域利用人工智能观看手术视频,并学习如何实时识别正在发生的情况。其核心理念非常简单:如果计算机能够被教会区分手术器械与重要器官,或者理解外科医生在任何给定时刻的具体操作,它最终就能在错误发生前发出危险警告。这需要教会机器不仅要看到形状,还要理解手术展开时的整个过程。

一个研究小组通过创建一个专门的手术瞬间库并教会计算机如何阅读这些瞬间,在实现这一目标方面迈出了重要一步。他们将重点放在了胃癌手术上,这种手术以难度大和并发症风险高而闻名。该团队收集了近三千帧真实手术视频帧,涵盖了传统的腹腔镜方法和较新的机器人辅助技术。从这些图像中,他们手动在每一个可见的手术器械和解剖结构(如胃、血管和淋巴结)周围绘制了详细的轮廓。他们还标注了它们之间的相互作用,创建了一个结构化的记录,说明使用了哪种工具、执行了什么动作以及接触了哪种组织。这项巨大的工程产生了一个包含近一万九千个不同注释的数据集,提供了一幅此前一直缺失的、关于手术视野的丰富且详细的地图。

有了这个新库,研究人员测试了一种被称为“基础模型”的强大人工智能类型。可以将这种模型想象成一名已经学习过数百万张医学图像并掌握了组织和工具通用规则的学生,而不是一个从零开始的学生。研究人员对这个经过预训练的“学生”进行了微调,使其专注于胃部手术视频。他们要求计算机执行两项任务:首先,在器械和器官周围绘制精确的边界;其次,识别视频中发生的特定“工具、动作与目标”的组合。他们将这种先进的方法与一种更传统、更简单的计算机视觉方法进行了对比,以观察哪种方法能更好地处理现实世界的复杂性。

结果显示,这种先进的基础模型在“观察与勾勒”任务方面表现得远为优异。当被要求识别手术器械时,该模型在超过95%的情况下都能正确匹配工具的形状与图像。在识别胃或血管等解剖结构时,它的成功率接近90%。相比之下,传统方法则表现得相当吃力,经常产生破碎或不完整的轮廓,遗漏关键细节。研究人员发现,先进的模型能够更好地应对手术中混乱的现实情况——例如工具有时会被血液或烟雾遮挡——这比旧技术做得好得多。这表明,基础模型对医学图像的先验知识使其在快速准确地学习胃部手术的细微差别方面具有明显优势。

第二项任务,即识别正在进行的特定动作,被证明更具挑战性,但仍有前景。研究人员要求计算机预测每一个事件的“三元组”:工具、动作和目标。例如,系统需要理解特定的器械正在切割一块脂肪组织。虽然计算机目前尚未达到完美,但其表现明显优于以往类似任务的尝试。分析显示,计算机在识别动作本身(如切割或拉拽)方面最为可靠,而在识别具体是哪种工具或哪个特定器官时准确度稍低。这可能是因为数据集中包含了许多常见动作,但对于罕见、复杂的动作案例却很少。研究人员指出,最困难的情况涉及那些仅在数据中出现过几次的罕见器械或特定解剖目标,这凸显出该系统仍需要更多接触这类不常见场景的经验,才能变得更加稳健。

研究结论认为,虽然这项技术尚未准备好独立进行手术,但它已经达到了足以作为未来安全工具之可行基础的准确水平。研究人员强调,这项工作的真正价值不在于数字本身,而在于它们所赋能的能力:一个系统可以在未来观察手术,并在工具过于靠近重要动脉或某个关键步骤执行不当时提醒外科医生。团队承认,他们的工作是基于来自单一医院的数据,且模型仍需在不同的医生和设备之间进行测试,以确保其具有普适性。然而,通过证明这些先进模型可以理解胃部手术复杂的视觉语言,这项研究为构建下一代手术引导系统提供了必要的底层技术基础,而这些系统有朝一日可以通过在错误发生前进行预防来挽救生命。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →