← 最新论文
🤖 AI

Boosting Generalizable Depth Estimation in Endoscopy by Mixture of Lightweight Experts and Intrinsic Image Alignment

本文提出了 EndoMINI,一种用于通用内窥镜深度估计的新颖自监督框架,该框架结合了用于参数高效适配的低秩专家混合机制(MiLoRE)和用于减轻光照干扰的内在图像对齐(IIA),在监督和零样本基准测试上均展示了卓越的性能。

原作者: Liangjing Shao, Beilei Cui, Yiming Huang, Changjing Liu, Hongliang Ren

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Liangjing Shao, Beilei Cui, Yiming Huang, Changjing Liu, Hongliang Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅凭一只手电筒在黑暗、潮湿的洞穴中穿行。如果光线在潮湿的墙壁上以奇怪的方式反射,或者每当你转过一个弯,洞穴看起来都截然不同,那么要判断墙壁距离有多远就会变得极其困难。这正是医生在进行微创手术时面临的挑战,因为他们使用的是微型摄像头(内窥镜)。人体内部是一个复杂的环境:组织是闪亮的,光线会产生剧烈的反射,而且每个患者的解剖结构各不相同。为了帮助机器人和外科医生实现 3D “视觉”,科学家们使用了一种叫做**深度估计(depth estimation)**的技术,这基本上是让计算机仅仅通过观察一张平面的图像来猜测物体的距离。虽然计算机在外部世界(如自动驾驶汽车)已经做得很好,但由于光照极度不一致且纹理如此独特,它们在人体内部经常会感到困惑。

这篇论文介绍了一个名为 EndoMINI 的巧妙新系统,旨在帮助这些摄像头更好地理解深度,即使在光照混乱或场景变化的情况下也是如此。研究人员通过两个主要技巧构建了这个系统。首先,他们创建了一个“专家团队”,而不是依赖一个通用的“大脑”。这就像一所学校,与其让一位老师尝试教给所有学生每一门学科,不如有一个智能开关,根据具体的课程(无论是数学、艺术还是历史)选择最合适的老师。在计算机的大脑中,这意味着它可以根据正在观察的是闪亮的肝脏还是暗淡的肠道,立即切换到正确的“专家”模式。其次,他们教会了计算机如何忽略眩光。就像你可能会眯起眼睛看穿窗户上的反射一样,这个系统学会了将组织的“颜色”与光的“闪烁”分离开来,从而即使在光线四处跳跃时也能准确测量距离。

团队在包括 SCARED 在内的多个数据集上测试了新的 EndoMINI 系统,发现它在预测距离方面比以往的方法更出色,无论是在经过类似图像训练的情况下,还是在面对完全陌生的视频(称为“零样本/zero-shot”测试)时。他们还展示了该系统可以计算摄像机的运动方式,甚至可以在没有预先告知的情况下预测摄像机自身的设置。结果表明,通过结合这种专门的专家和忽略令人困惑的眩光的方法,该系统可以为外科医生提供更清晰的 3D 视图,从而可能使机器人手术更加安全和精准。

问题所在:为什么内窥镜深度难以捉摸

深度估计是判断物体距离摄像头有多远的技术。在外部世界,计算机已经对此非常擅长,但在人体内部,这简直是一场噩梦。论文指出了两个主要的“反派”:

  1. “闪亮”问题: 体内的组织是湿润且具有反射性的。光线以不可预测的方式从它们身上反射,使平坦的表面看起来像凸起或凹陷。
  2. “每次都不同”问题: 每个患者都是不同的,甚至同一个患者的不同部位看起来也各具特色。一个被训练用来识别某种特定组织的模型,可能会被另一种组织彻底搞糊涂。

现有的方法试图解决这些问题,但往往难以适应这些新场景或忽略灯光的刺眼眩光。

解决方案:专家团队与眩光过滤器

作者提出了 EndoMINI,这是一个通过两种创新方法应对这些问题的全新框架。

1. 低秩专家混合机制 (MiLoRE)
想象一个图书馆,你通常必须向一位图书管理员寻求帮助。如果你询问一本稀有书籍,他们可能不知道答案。现在,想象一个拥有智能机器人的图书馆,它知道该向哪位专家求助。如果你问关于历史的问题,它会呼叫历史专家;如果你问关于科学的问题,它会呼唤科学专家。

在 EndoMINI 中,计算机使用了一种“低秩专家混合机制”(MiLoRE)。系统不再拥有一个试图学习一切的巨大且僵化的脑,而是拥有一个“路由”(router),它观察图像并决定激活哪些小型、专门的“专家”模块。

  • 工作原理: 该系统使用了一种名为 LoRA(低秩自适应)的技术,这就像是在一个现有的智能大脑上添加一层小巧、可调节的“辅助轮”。MiLoRE 系统拥有多个这样的微型专家。当摄像头看到特定类型的组织时,路由会挑选出最合适的专家(或多个专家的组合)来处理该特定场景。
  • 结果: 这使得模型能够快速适应不同的内窥镜场景,而无需从头开始重新训练。它既高效又灵活。

2. 本征图像对齐 (IIA)
现在,让我们谈谈眩光。当你拍摄一个闪亮物体时,那个亮点会让你难以看清物体的真实形状。论文引入了一种方法,将物体的“真实颜色”与光的“阴影/闪烁”分离。

  • 类比: 想象一幅画。油漆本身是“反射率”(组织的真实颜色),而照射在上面的光是“阴影”。论文中的系统学会了将这两者剥离开来。它使用一个特殊的网络将图像分解为“反射图”(组织实际的样子)和“阴影图”(光线照射的位置)。
  • 神奇之处: 通过在不同视频帧之间对齐“反射率”图,系统可以计算深度而不受变化的灯光干扰。它本质上是在说:“忽略那个亮点;观察下方的实际颜色。”

他们的发现

研究人员在三个数据集上测试了 EndoMINI:SCAREDHamlynSERV-CT。这些数据集包含了来自机器人手术的真实视频。

  • 监督性能: 在已知答案的 SCARED 数据集上,EndoMINI 打败了所有其他最先进的方法。例如,它实现了 0.047绝对相对误差 (RelAbs),低于排名第二的方法 EndoDAC 的 0.052
  • 零样本性能: 这是真正的考验。模型在 SCARED 上进行训练,然后被要求在没有任何额外训练的情况下,在 Hamlyn 和 SERV-CT 数据集上猜测深度。EndoMINI 依然名列前茅,显示出它在处理新环境时具有良好的泛化能力。在 Hamlyn 数据集上,它实现了 0.140 的 RelAbs,超过了之前的最佳水平 0.143 (DVSMono)。
  • 自我运动与相机设置: 该系统不仅能猜测深度,还能计算摄像机的运动方式(自我运动),甚至能高精度地预测摄像机的内部设置(内参),其表现优于那些依赖预设参数的方法。

为什么这很重要

论文总结道,通过将灵活的“专家团队”(MiLoRE)与智能忽略眩光的方法(本征图像对齐)相结合,EndoMINI 为内窥镜手术创造了更可靠的 3D 视图。这不仅仅是一个微小的改进;这是朝着让机器人手术更安全、更精准迈出的重要一步,因为机器人终于可以像人类外科医生希望的那样,清晰地“看见”体内的世界。作者指出,这种高质量的 3D 感知能力可能会成为微创手术领域的游戏规则改变者,帮助外科医生充满信心地应对复杂的解剖结构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →