← 最新论文
💻 computer science

Surgical Anatomy Recognition with Context Learning using Foundation Representations

本文介绍了 ATLAS-120k,一个用于微创手术的大规模标注数据集,以及 ATLAS,一种利用基础表示和上下文学习来实现准确且具有时间一致性的解剖结构识别的视频分割模型。

原作者: Ronald L. P. D. de Jong, Tim J. M. Jaspers, Raf A. H. Vervoort, Aron F. H. A. Bakker, Yiping Li, Jip L. Tolenaar, Jelle P. Ruurda, Willem M. Brinkman, Josien P. W. Pluim, Marcel Breeuwer, Daan de Geus
发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ronald L. P. D. de Jong, Tim J. M. Jaspers, Raf A. H. Vervoort, Aron F. H. A. Bakker, Yiping Li, Jip L. Tolenaar, Jelle P. Ruurda, Willem M. Brinkman, Josien P. W. Pluim, Marcel Breeuwer, Daan de Geus, Fons van der Sommen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何进行手术。最大的问题不仅仅是教机器人识别肝脏或胆囊的长相;而是要教机器人理解手术的“故事”。在真实的操作系统中,外科医生不仅仅是在看一张静态的照片;他们知道正在进行的是哪种手术,处于手术的哪个阶段,并且他们会记住几秒钟前看到了什么,从而来理解现在的景象。

这篇论文介绍了两项技术,旨在帮助计算机更好地实现这种“手术叙事”。

1. 新的库:ATLAS-120k

将之前的手术视频数据集想象成一些小型的相册,每个相册只展示一种特定类型的手术(比如仅仅是阑尾切除术)或仅包含几个特定的场景。它们规模太小,且过于重复,无法教会计算机如何处理现实生活中复杂多变的情况。

作者创建了 ATLAS-120k,这就像是构建了一部宏大的、全面的手术百科全书。

  • 规模: 它包含超过 120,000 个标注帧(单张图像),这些图像取自 100 段不同的手术视频
  • 多样性: 它并非只涵盖一种手术,而是涵盖了 14 种不同的手术程序(如胆囊切除术、结肠修复术或肾脏切除术)。它既包括标准腹腔镜手术(使用长柄器械和摄像头),也包括机器人辅助手术。
  • 质量: 为了确保标签的完美无瑕,团队采用了“人机协同”的方法。想象一下,由专家医生和受训者手动标注视频的第一帧,然后使用智能计算机将这些标签复制到后续帧中。如果计算机出现了错误,人类会进行修正。随后,由资深外科医生进行最终审核。这确保了 AI 学习的这本“字典”是准确无误的。

2. 新的大脑:ATLAS 模型

有了这个库之后,他们需要一个能阅读它的“大脑”。目前大多数用于视频的 AI 模型更像是保安,只能追踪移动的物体(比如跟随行走的人)。它们擅长说:“那个物体从左向右移动了”,但它们很难理解“语境”。

在手术中,语境就是一切。一块组织在某一时刻看起来可能像肿瘤,但在下一刻可能看起来像普通的脂肪,这取决于外科医生当前是在切割还是在缝合。

作者构建了一个名为 ATLAS(利用基础表示进行上下文学习的解剖识别)的模型。以下是它的工作原理,我们用一个简单的类比来说明:

  • 基础(Foundation): 该模型始于一个“预训练大脑”(基础模型),它已经掌握了大量关于图像的知识,类似于一名医学生在开始住院医师实习之前已经读过许多解剖学教科书。
  • “是什么”查询("What" Queries): 它拥有特殊的“查询”(类似于便利贴),询问:“这是什么物体?”以及“它在哪里?”
  • “故事”查询("Story" Queries —— 核心秘诀): 这是本论文的主要创新点。模型增加了两种新型的便利贴:
    1. 程序查询(Procedure Queries): 它们告诉模型:“我们正在进行胆囊切除术。”这有助于模型意识到它应该寻找胆囊,而不是心脏。
    2. 阶段查询(Phase Queries): 它们告诉模型:“我们目前处于‘切割’阶段,而不是‘缝合’阶段。”这有助于模型理解,即便现在的视野与五秒钟前相比发生了变化,当前的解剖结构也应当符合当前的阶段。
  • 记忆力(Memory): 该模型还拥有短期记忆。它会将信息从一帧传递到下一帧,因此如果它在第 1 帧看到了一个工具,即使在第 2 帧视图变得模糊,它也会记得该工具之前的位置。

3. 结果

团队将这个新大脑与其他顶尖的 AI 模型进行了对比测试。

  • 更高的准确度: ATLAS 在正确识别解剖结构方面击败了所有其他模型。
  • 稳定性: 它在时间维度上能更好地保持预测的稳定性(不会每秒钟都在“这是肝脏”和“这是肾脏”之间反复横跳)。
  • 速度: 尽管非常聪明,但它的运行速度足以支持实时工作(每秒 64 帧),这对于手术至关重要。

总结

该论文声称,通过结合一个庞大且多样化的数据集(ATLAS-120k)和一个能够理解手术“故事”的模型(ATLAS),他们为计算机理解手术场景创造了一个更强大的基础。他们认为,要让手术变得更安全、更精准,AI 需要停止仅仅观察图片,转而开始理解语境、手术程序以及时间的流动。

注:本文的研究重点在于创建该数据集和模型,以改进“手术场景理解”。它并不声称该系统目前正被用于指导患者的实时手术,而是表明它为未来的此类系统提供了必要的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →