Sterilizable Scene Graph Generation for Operating Rooms
本文介绍了一种名为 SG-NCA 的轻量级、可灭菌场景图生成框架,该框架基于神经细胞自动机,在实现与最先进模型相当的性能的同时,参数量减少了 55 倍,从而能够在适用于手术室的无风扇边缘设备上实现保护隐私且实时的手术场景理解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在手术室内,空气中弥漫着一场救命手术所特有的静谧与紧张感。外科医生手的每一次移动、手术器械的每一次位移,以及正在处理的组织发生的每一次细微变化,都在诉说着一个故事。几十年来,计算机一直难以读懂这个故事。它们能看到屏幕上的像素,却难以轻易理解所见物体之间的关系:例如一个金属抓钳正夹着一块组织,或者一个钩子正切开它。这种勾勒场景图谱、不仅理解存在什么而且理解事物如何相互作用的能力,被称为场景图生成(scene graph generation)。它是赋予机器对手术进行整体理解的关键,这种理解在未来有望通过提供实时指导或创建手术自动记录来辅助医生。然而,目前能够胜任此项工作的计算机需要庞大的工作站,而这些设备体积过大、发热过高,且难以在精密的手术环境中保持无菌。
一支研究团队现在发现了一种方法,可以将这种复杂的思考过程缩减到可以容纳在简单的无风扇设备上的规模。他们开发了一种名为 SG-NCA 的新方法,该方法允许计算机观看手术视频并立即构建出场景的结构化地图,识别工具和身体部位,并描述它们是如何相互关联的。这一突破在于他们构建系统的方式。他们没有使用通常驱动此类人工智能的庞大、沉重的软件模型,而是转向了一种更轻量化的方法,其灵感源自简单的细胞如何根据邻近细胞更新自身状态。通过采用循序渐进的课程进行训练——从最常见的物体开始,逐渐增加更多物体——他们教会了系统识别眼科和胆囊手术中的特定工具和解剖结构。结果显示,该系统的表现与研究实验室中使用的巨型模型一样出色,但运行所需的内部参数设置却减少了五十五倍。
研究人员在白内障手术和胆囊切除术的视频上测试了他们的新系统,这两类手术都对精准度有着极高的要求。他们发现,尽管该轻量化模型规模微小,但在识别手术工具和身体部位方面的准确度仍能与现有的最佳方法相媲美。虽然用于对比的标准模型包含数百万个参数(即计算机通过调整来学习的内部“旋钮”和“拨盘”),但他们的新系统仅需其中的一小部分。事实上,整个系统非常小,可以在标准的智能手机或小型低功耗计算板上运行,无需专门的显卡或强大的服务器。这对于手术室而言意义重大。目前用于此类工作的庞大计算机通常带有会吹风的散热风扇,这可能会传播灰尘和细菌,是手术环境中主要的风险因素。此外,它们还占据了本就挤满了设备的房间内的宝贵空间。相比之下,新系统可以在密封的、无风扇的设备上运行,这些设备易于擦拭和消毒,从而保持空气清洁,并将数据安全地保留在手术室内。
除了识别物体之外,该系统还展示了其理解手术流程的能力。它可以生成描述正在发生情况的简单句子,例如指出抓钳正在回拉胆囊,而钩子正在对其进行解剖。这种能力表明,该系统可以超越简单的检测,进而实现对手术叙事的深度理解。团队还展示了这项技术可以部署在网络边缘,这意味着处理过程发生在病床旁,而不是发送到远程的云端服务器。这既保护了患者数据的隐私,又消除了因通过互联网传输信息而产生的延迟。通过证明如此精简的系统也能处理真实手术的复杂性,研究人员开启了一扇通往未来的大门——在那个未来,先进的手术智能不再被锁定在庞大且难以防菌的障碍之后,而是可以利用价格实惠、符合卫生标准且能自然融入手术流程的硬件来实现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。