← 最新论文
🤖 AI

RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

RefineRank 引入了一个轻量级的可训练模块,通过融合来自冻结的医学视觉-语言模型和开集检测模型的特征,共同精炼边界框坐标并对候选对象进行排序,从而在不重新训练骨干网络的情况下,实现了最先进的手术时空定位性能。

原作者: Linzhe Jiang, Jiayuan Huang, Changhao Zhang, Chunyang Jiang, Zhehua Mao, Mobarak I. Hoque

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Linzhe Jiang, Jiayuan Huang, Changhao Zhang, Chunyang Jiang, Zhehua Mao, Mobarak I. Hoque

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在手术室里,外科医生的双手动作精准,几乎没有任何容错余地。为了教会计算机理解这些复杂的视频,研究人员长期以来一直依赖两种不同类型的人工智能。其中一种类型就像一名受过高等教育的医学生:它能够阅读关于手术中特定时刻的问题并理解上下文,但当被要求指出物体时,它给出的位置往往模糊或不准确。另一种类型则像一名目光敏锐的保安:它能识别出视频帧中的几乎任何物体并为其画出一个框,但它无法理解所提出的具体问题,因此经常会标错工具或标错手部。科学家们面临的挑战在于,如何在不强迫它们重新学习如何观察世界的前提下,将第一种类型的深度理解力与第二种类型的敏锐视觉结合起来。

一支研究团队现在通过一个名为 RefineRank 的新系统弥补了这一差距。他们并没有试图将这两个复杂的 AI 模型合并成一个庞大且难以训练的单一大脑,而是构建了一个位于两者之间的小型专门模块。这个模块充当了翻译器和质量控制器的角色。它接收由“保安”检测器绘制的候选框列表,以及来自“医学生”语言模型的深度理解。对于检测器提出的每一个候选框,新模块都会同时执行两项任务。首先,它会对框的坐标进行微小的、精确的调整,如果原始框略有偏差,它会将框向实际物体方向轻微挪动。其次,它会为该框分配一个质量评分,不仅判断该框与通用词汇的匹配程度,还判断其对关于手术的具体、带时间戳问题的回答程度。

该系统的运作方式是保持这两个强大的 AI 模型处于“冻结”状态,这意味着它们不会被改变或重新训练。新模块仅仅观察检测器已经找到的框以及语言模型已经提取的特征,然后决定哪个框是最佳答案。如果检测器围绕一个手术器械画了一个框,但错过了器械尖端几个像素,该模块就会修正位置。如果检测器画了一个完美的框,但语言模型知道这个框实际上并不符合问题的要求,该模块就会给这个框一个低分并忽略它。最终的决策由一个简单的规则做出:从原始框和修正后的框组成的列表中,挑选出得分最高的那个框。这种方法避免了对整个系统进行复杂、沉重的训练,而是依靠一个连接现有两种技术的轻量级插件。

在手术视频基准测试中,这种方法被证明是非常有效的。在一套用于对手术 AI 系统进行排序的标准测试集中,这种新方法取得了 0.421 的得分,这是该研究进行时针对此特定任务所记录到的最高分。为了理解其意义所在,研究人员深入研究了系统的表现。他们发现,通过将框微调到更好位置的能力,将系统的理论最佳性能从 0.6772 提升到了 0.7302。这表明检测器本身遗失了一些精度,而新模块可以将其找回。此外,模块正确排序框的能力甚至更为关键。当系统仅仅选择检测器置信度最高的框时,得分仅为 0.2719。而通过使用新模块学习到的评分来选择最佳框,性能跃升至 0.4534。

研究人员还测试了是否可以使用另一个更复杂的计算机程序来比模块自带的评分系统更好地挑选出“优胜者”。他们训练了几种不同类型的选择器,让它们从相同的候选框列表中挑选最佳框。结果没有一个比模块自身的内部评分表现得更好。事实上,该模块原生的评分规则仍然是最强的方法,这表明这个小模块已经学会了针对特定手术问题判断框质量的最有效方式。该系统确实存在局限性:如果初始检测器完全未能围绕目标物体画出框,系统就无法找到它。然而,在它所提供的框的范围内,该系统成功地调和了深度理解与精确定位的需求,证明了通过一个小型且专注的增补,可以显著改善机器如何观察和理解复杂的医疗手术世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →