S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks
本文介绍了 S3-Tracker,这是一种通过在无标注内窥镜视频上利用对比随机游走来实现稳健的手术组织追踪的自监督方法,其效果可媲美半监督方法,从而克服了获取大规模标注数据集在计算机辅助干预中的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人体内部,手术摄像机的视角通常是一个由柔软、湿润的组织构成的不断变化的景观,这些组织在器械的压力下进行着拉伸、折叠和滑动。对于外科医生以及辅助他们的机器人而言,保持对每一块组织位置的稳定心理地图是一个持续的挑战。如果外科医生需要将他们在屏幕上看到的内容与术前的扫描图像(如 CT 或 MRI)进行匹配,那么当组织发生实时形变时,这项任务几乎变得不可能实现。为了解决这个问题,计算机需要追踪视频帧中组织上的特定点,从而在实时视图与患者的内部解剖结构之间建立起一种连续的联系。虽然现代人工智能在追踪标准视频中的物体方面已经做得相当出色,但手术中充满血迹、烟雾和高反射表面的混乱现实,使得很难教会计算机如何可靠地完成这项工作,而不依赖于海量的人工标注数据。
一个研究小组开发出了一种新的方法,用于教计算机追踪手术组织,而无需那些难以获取的标签。该方法并非通过向计算机展示数千段由人类辛勤绘制点和线以展示运动轨迹的视频,而是通过观察视频本身并检查其自身的工作来进行学习。该系统将视频视为一系列相互连接的时刻,并提出了一个简单的问题:如果我从一帧中的 A 点移动到下一帧中的 B 点,然后尝试从 B 点移回 A 点,我是否能回到完全相同的起点?通过迫使计算机反复正确地回答这个问题,它就能理解像素是如何移动和变形的,即使组织在不同时刻看起来非常不同。这种方法使系统能够从大量的未标记手术录像中学习,绕过了需要人类专家对每一帧进行标注的瓶颈。
研究人员构建的系统通过观察视频帧对,来弄清楚一帧中的像素如何与下一帧中的像素相关联。他们使用一种创建连接映射的过程,本质上是要求计算机猜测一块组织所经过的最可能的路径。为了确保计算机不仅仅是在随机猜测,系统通过运行正向运动和反向运动来检查自身的逻辑。如果正向路径和反向路径没有在同一地点汇合,系统就知道自己犯了错误,并据此调整其理解。这种被作者称为“对比随机游走”(contrastive random walk)的自我检查机制,使得模型能够在从未见过任何人类提供的正确答案的情况下,学习组织拉伸和弯曲的复杂方式。该系统还包含一种判断一个点是否不再可见的方法(例如,可能因为被血液或器械遮挡),并在其重新出现之前停止追踪,从而防止计算机产生困惑并偏离航向。
在真实的手术视频数据集上进行测试时,这种新方法证明了自己是现有依赖部分人工标注系统的强有力竞争者。研究人员发现,这种自监督学习方法追踪点的准确度可以媲美那些经过部分人工引导训练的方法,同时运行速度明显更快,能够实现实时处理。在衡量预测点与实际真值之间偏差的测试中,该系统的表现足以被认为具备临床应用价值,在各种误差阈值下达到了 0.708 的平均准确度得分。虽然全监督模型(使用完整人工标签的模型)在原始误差距离方面有时可能略微更精确,但它们通常太慢,无法在实时手术过程中逐帧运行。相比之下,这种新方法运行效率足够高,可以跟上视频流的速度,每秒处理三帧。这种速度结合其在无需预标记数据的情况下处理手术视觉混乱的能力,表明自监督追踪有望成为指导机器人手术并帮助外科医生在人体复杂的移动地形中进行导航的实用工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。