← 最新论文
🤖 AI

Supervised Mixture-of-Experts for Surgical Grasping and Retraction

本文提出了一种监督式混合专家架构,使轻量级模仿学习策略能够仅凭立体内窥镜图像和少于 150 次演示,即可在可变形组织上实现鲁棒且数据高效的抓取与回缩操作,该策略在分布内及具有挑战性的分布外场景中均显著优于标准模型,并成功展示了向离体及初步活体猪手术的零样本迁移能力。

原作者: Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,在患者体内,人类外科医生与机器人助手之间进行着一场高风险的舞蹈。外科医生是领舞者,精准地指出每一步该落在何处;而机器人则是舞伴,必须瞬间理解指令,抓起一块滑溜的组织(就像一根面条),并将其稳稳握住,既不掉落也不伤及任何周围组织。

本文提出了一种新方法,教导机器人如何跳这支特定的舞蹈,即使机器人从未见过完全相同的动作,且练习时间非常有限。

以下是他们方法的分解,使用了简单的类比:

问题:“一刀切”的机器人失败了

通常,当我们尝试教导机器人执行复杂任务时,会使用庞大的“通才”模型。可以把这些模型想象成一位超级聪明的学生,他读遍了图书馆里的每一本书,却从未真正握过手术刀。

  • 问题所在: 当你要求这位超级聪明的学生进行精细手术时,他会感到困惑。他可能会在尚未准备好时就试图抓取组织,或者用力过猛。
  • 现实情况: 在这项研究中,这些“通才”模型完全失败了。即使提供了标准的训练数据,它们也无法学会这项任务。它们过于庞大、速度太慢,并且被手术中具体而混乱的现实搞得晕头转向。

解决方案:“专业团队”(混合专家模型)

作者没有让一个巨大的大脑试图包揽一切,而是构建了一个监督式混合专家(MoE)系统

想象一个由小型、敏捷的专家团队组成的团队,而不是一个通才:

  1. 团队: 与其拥有一个机器人大脑,不如拥有五个微小的、专业化的专家。
    • 专家 1: 只懂得“待机”(等待)。
    • 专家 2: 只懂得“接近并抓取”。
    • 专家 3: 只懂得“保持静止”。
    • 专家 4: 只懂得“轻柔回拉”。
    • 专家 5: 只懂得“维持张力”(保持握住而不移动)。
  2. 管理者(门控网络): 有一位聪明的管理者在观察手术过程。当外科医生指向某个位置时,管理者会立即唤醒“抓取者”专家,并让其他专家休息。当组织被抓住后,管理者会切换到“保持者”专家。
  3. 训练: 关键在于,研究人员并没有让管理者随意猜测该选择谁。他们给管理者提供了一份“小抄”(标注数据),上面写着:“此刻,我们正处于‘抓取’阶段。”这迫使团队完美地掌握各自的具体工作。

结果:快速、轻量且精准

团队将这支“专业团队”与“通才”模型以及标准机器人策略进行了测试对比。

  • 速度: 专业团队的速度极快(每秒 27 次),这对于实时手术是必要的。而通才模型的速度太慢(每秒 3 到 10 次),在真实手术中毫无用处。
  • 成功率:
    • 通才模型:0% 成功。它们无法完成任务。
    • 标准机器人:50% 成功。它有一半时间能工作,但经常掉落组织。
    • 专业团队(MoE):85% 成功。它能可靠地抓取并保持组织。
  • 数据效率: 团队仅用少于 150 次演示就学会了这支复杂的舞蹈。这就像只看几次表演就能学会一套新舞步,而其他方法通常需要数千次尝试。

“魔法”技巧:泛化能力

该论文声称机器人实现了两项主要的“魔法”技巧,即在无需额外训练的情况下取得了成功:

  1. “新角度”技巧: 机器人是在从特定角度观察场景的情况下进行训练的。然而,当从完全不同的角度(放大、缩小、倾斜)进行测试时,它仍然有效。它学到了任务的概念,而不仅仅是训练期间看到的特定画面。
  2. “零样本”技巧(离体): 机器人完全是在一个假塑料模型(phantom)上进行训练的。当他们把塑料换成真实的猪组织(滑溜、柔软且移动方式不同)时,机器人在没有进行任何新训练的情况下,仍然有**80%**的成功率。它瞬间将其技能从虚假世界转移到了真实世界。

核心结论

作者表明,对于精细的、多步骤的手术任务,你不需要一个庞大、缓慢、通用的 AI。相反,你需要一个轻量级、专业化的团队,它确切地知道在任何给定时刻自己正在执行任务的哪一部分。

通过使用这种“专业团队”方法,他们仅利用摄像头视角、极少量的数据以及无需额外传感器,就教会了机器人抓取并保持组织,证明了即使在摄像头角度改变或从塑料模型转移到真实组织时,该系统也能正常工作。他们还展示了该系统在活体猪手术中早期成功的测试,表明其已准备好迈向实际人类应用的下一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →