← 最新论文
⚡ electrical engineering

Learning-based Hierarchical Tracheal Anatomy Understanding from Sparse Surgical Demonstration Annotations for Ultrasound Robots

本文提出了一种结合了 YOLOv8n 定位骨干网络与稀疏、提示优化 SAM2 解码器的学习型框架,旨在实现用于超声引导机器人气切术的鲁棒、实时气管解剖结构分割,在准确性和泛化能力方面显著优于 U-Net 基准模型,同时实现了闭环机器人远程操作。

原作者: Hiu Ching Cheung, Wenchao Yue, Zhengran Han, Mingcong Chen, Guanglin Cao, Hongbin Liu, Hongliang Ren

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Hiu Ching Cheung, Wenchao Yue, Zhengran Han, Mingcong Chen, Guanglin Cao, Hongbin Liu, Hongliang Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座巨大的、雾气缭绕的城堡里寻找一间特定的、微小的房间。因为雾气太厚,你看不清墙壁,而且这间房间看起来和旁边的房间一模一样。这就是医生进行气管切开术(一种通过在患者气管上开孔以帮助其呼吸的程序)时的日常现实。通常,医生必须用手触摸颈部,来猜测气管环的位置。但如果患者颈部脂肪过多或肿胀,这就好比隔着一件厚重的冬装去寻找那间房间——这纯粹是在靠猜测,而且有时猜错了。

为了解决这个问题,医生使用超声波,它就像一把可以不切开身体就能看清内部情况的手电筒。然而,拿着超声探头非常困难;如果医生的手抖动或者角度稍微偏了一点,图像就会变得模糊或显示错误的内容。这就是机器人发挥作用的地方。科学家们正在制造能够稳稳握住超声探头的机械臂,就像一只超级稳定的手。但为了让机器人知道“该看哪里”,它需要一个能够理解这些模糊、多雾图像的“大脑”。挑战在于:如何教会机器人从嘈ole(嘈杂/充满噪声)且移动的图像中识别出特定的气管环,从而安全地引导外科医生。

这篇论文介绍了一个聪明的全新“大脑”,旨在即使在数据混乱或不完整的情况下也能理解气管的解剖结构。研究人员构建了一个类似于侦探团队的两步走系统。首先,一个快速、轻量级的检测器(称为 YOLOv8n)会扫描整个图像以找到气管的大致区域,扮演着从远处发现城堡的“侦察兵”的角色。一旦侦察兵指出了位置,第二个更强大的模型(称为 SAM2)就会放大并精确地勾勒出气管环的轮廓,扮演着绘制房间精确形状的“大师级艺术家”的角色。

团队使用结合了精心记录的实验室视频和从网上搜集的杂乱真实世界视频对该系统进行了测试。他们发现,这个两步走的团队表现得极其出色。在受控的实验室环境和杂乱的真实世界测试中,他们的系统都能以约 77.7% 的准确率(一种被称为平均 Dice 相似系数的分数)正确识别气管结构。这比旧方法有了显著提升,旧方法在面对新的、陌生的图像时经常会产生混乱,准确率往往跌破 50%。此外,该系统的速度足以跟上实时视频流,每秒处理约 6.92 帧。这种速度至关重要,因为这意味着当患者移动或医生移动探头时,机器人可以立即更新其引导信息。

该论文还明确排除了在这一特定任务中使用较旧的单步系统(如标准的 U-Net)。研究人员展示了虽然这些旧系统在完美的实验室条件下表现尚可,但在面对不可预测的真实世界超声图像时却会崩溃,经常将背景噪声误认为实际的解剖结构。他们还证明,仅仅单独使用强大的“大师级艺术家”模型(SAM2)是行不通的,因为它在没有“侦察兵”告诉它该看哪里时会迷失方向。论文得出结论,通过将快速的侦察兵与精准的艺术家相结合,并利用干净与杂乱数据的混合进行训练,他们创造了一个能够应对真实患者多样性的稳健系统。这为更安全、更自动化的机器人手术指明了一条充满希望的路径,尽管作者指出,该系统仍需在更多样化的患者群体中进行更多测试,并提高处理速度,才能准备好应对最苛刻的闭环机器人控制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →