Action-grounded tissue affordance enables anticipatory auto-framing that lowers surgeon cognitive workload during laparoscopic surgery
该论文介绍了 DiffeoAfford,这是一个以动作为基础的框架,它能从手术过程中自动生成视觉注意力标签,从而为 AffordView 提供动力,该系统是一种能够与专家注视点对齐的自动构图系统,并能显著降低腹腔镜手术中外科医生的认知负荷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图跟随电影中的一场高速追逐戏,但摄像师有点反应迟钝。在汽车转弯之前,他们总是把镜头对着空荡荡的街道,或者因为被一棵树吸引了注意力而错过了爆炸场面。在现实世界的医学领域,特别是一种被称为腹腔镜手术的类型中,外科医生面临着一个类似但更为危险的版本。他们是在患者体内使用长形器械进行操作,并通过视频屏幕进行观察,但他们无法一次看到全景。为了看到正确的部位,他们需要一台能够完美跟随其双手和视线的摄像机。
这里的大挑战在于,这个“摄像师”通常是一名人类助手。这位助手必须猜测外科医生下一步想看哪里,而这种猜测往往并不准确,导致外科医生不得不大喊:“向左移!”或“放大!”这种不断的喊叫和纠正,就像是在有人不停拍你肩膀时试图解一道数学题一样;这会消耗大量的心理负荷,即所谓的“认知工作量”。科学家们曾尝试开发计算机来胜任这项工作,但遇到了瓶颈:要教计算机识别要寻找的目标,通常需要人类在视频的每一帧中画出一个框来标出重要位置。但在手术中,“重要位置”并不是像汽车那样静态的物体;它是一块柔软、移动且每秒都在变形的组织。专家知道该看哪里,但他们无法解释自己遵循的规则。这就像一位大师级厨师,能尝出汤里缺了什么,却无法写下那份食谱。
这篇论文介绍了一种巧妙的方法,旨在教会计算机成为那位不需要书面食谱的大师级厨师。由华中科技大学及其它团队领导的研究人员开发了一个名为 DiffeoAfford 的系统。该系统不再要求人类去预测动作将发生在哪里,而是让计算机在手术结束后进行观察。计算机通过观察外科医生的器械并分析道:“啊,外科医生在这里触碰了这块特定的组织,然后移动到了那里。这意味着,这里才是重要的目标点。”通过使用一种被称为“微分同胚”(diffeomorphism,类似于一种保持组织不发生不可能的撕裂或折叠的橡胶片拉伸映射)的特殊数学技巧,该系统可以沿着时间轴向后追踪外科医生的动作,从而精确找出哪些部分的柔软组织才是目标。
一旦计算机学会了这种基于“动作”的映射,它就能在外科医生移动手部之前,预判他们下一步将看向哪里。他们开发了一款名为 AffordView 的应用程序,利用这种预测功能自动将摄像机中心对准正确的部位。在真实手术中的测试结果令人印象深刻。该系统不仅是在进行猜测,它的对焦与外科医生的实际视线一致性甚至优于人类摄像助手。事实上,计算机对下一步动作的预判如此出色,以至于减轻了外科医生的心理压力。外科医生的脑电波显示他们没那么疲劳,他们的瞳孔(当人感到压力或高度专注时会放大)也保持得更平稳,而且他们向助手发出的口头指令也减少了。这项研究表明,通过让计算机从外科医生自身的动作中学习,而非依赖人工标注,我们可以创造出一个“智能摄像机”,它能像一个完美的、沉默的搭档一样,让外科医生能够全身心地投入到拯救生命中,而不是忙于对摄像机大喊大叫。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。