← 最新论文
🤖 AI

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

本文介绍了 SurgRAW,这是一种利用思维链推理和新基准测试(SurgCoTBench)的多智能体工作流,通过层次化协作和检索增强生成,克服了孤立模型和通用视觉语言模型的局限性,从而实现了对机器人手术场景卓越且符合临床逻辑的零样本理解。

原作者: Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代手术室中,机器人系统已成为不可或缺的工具,使外科医生能够进行精细的手术,实现仅凭人类双手有时无法达到的精准度和稳定性。这些机器通常由高清晰度摄像头引导,将外科医生的动作转化为患者体内微小且受控的操作。然而,为了让这些系统在未来真正发挥辅助作用,它们必须不仅仅是移动器械,还必须理解屏幕上正在发生的事情。这需要一种能够观察手术视频并理解其中复杂叙事过程的人工智能:识别正在使用的工具、识别外科医生正在进行的特定动作,并预测接下来的步骤。挑战在于手术场景在视觉上是混乱的,器械与组织经常重叠或快速移动,这使得计算机在解释场景时极易产生困惑或凭空捏造不存在的细节。

长期以来,研究人员一直试图教会计算机理解这些场景,但以往的尝试通常依赖于为单一任务设计的独立程序,例如一个程序用于寻找工具,而另一个程序用于命名动作。这种方法创造了一种碎片化的手术观,即计算机无法将它所看到的现象与其背后的意义联系起来。近年来,强大的语言模型已被改编用于观察图像,为通过视觉问题进行推理提供了途径。然而,当应用于手术领域时,这些通用模型往往难以应对手术室专业的语言和逻辑,频繁出现自信却错误的回答,或者无法理解手术的逐步流程。为了解决这一问题,一组研究人员开发了一种新系统,该系统模仿了手术团队协作的方式,利用一种结构化的、循序渐进的推理过程来分析机器人手术视频,从而实现了前所未有的准确度。

该团队引入了一个名为 SurgRAW 的新框架,其代表着一种专为手术智能设计的推理工作流。该系统并非要求单个人工智能观察视频帧并猜测答案,而是将问题分解为多个专业化“智能体(agents)”之间的协调协作。想象一下,一群专家围坐在桌旁,每人都有特定的角色:一个专注于识别器械,另一个专注于执行的动作,第三个则关注患者的背景情况。在这个数字专家组中,这些智能体并非孤立工作;它们会讨论证据、检查彼此的逻辑,并在得出最终结论前不断完善结论。这种方法建立在一个由研究人员创建的新数据集之上,该数据集包含数千个从真实手术视频中提取的问题与答案对,涵盖了五个关键的推理领域:识别器械、识别动作、预测下一步、理解患者细节以及评估手术结果。

为了确保系统具备外科医生的思维方式,研究人员设计了特定的指令,引导人工智能通过逻辑思维链进行思考。系统并不让模型直接跳到结论,而是强制它首先分析问题,然后从图像中提取视觉细节,将这些细节与已知的医学规则进行交叉比对,排除不可能的选项,最后根据整体场景验证答案。对于需要视频之外知识的任务,例如预测复杂程序中的下一步,系统还会查阅数字医学指南库,以确保其推理基于既定的事实。这种结构化推理、智能体间的协作辩论以及对经过验证的医学知识的调用相结合,使得系统能够避免人工智能常见的陷能,例如幻觉出不存在的细节,或误解工具与组织之间的关系。

测试结果令人瞩目。与现有的包括那些经过大量医疗数据训练的人工智能模型相比,新系统的表现显著提升。在衡量各种手术任务准确性的测试中,该系统的表现比标准的监督学习模型高出 14.61%,这在这一领域是一个巨大的差距。它还展示了卓越的一致性,在不同运行之间产生可靠的结果且波动极小,而其他模型往往会在性能上剧烈波动。该系统在需要深度理解的任务(如预测手术下一步或从视觉线索中推断患者细节)方面表现尤为出色,而这些领域正是以往模型最难攻克的领域。通过成功整合这些不同的推理流,研究人员表明,一种统一的、协作的方法比孤立的方法能提供更清晰、更准确的手术理解。

这项工作代表了使人工智能成为手术室中值得信赖的伙伴的重要一步。通过从简单的模式识别转向一个能够推理、辩论并验证自身结论的系统,研究人员创造了一个能够以符合临床现实的方式解释其思考过程的工具。该系统不仅能识别工具,还能理解该工具正在做什么以及为什么要这样做;它不仅是在观察一帧画面,而是在理解整个手术的过程。虽然目前的系统是在连续视频采样的单帧图像上运行,但其底层逻辑旨在支持手术复杂的流动特性。研究人员计划通过引入更多类型的程序,并探索系统如何学习来自外科医生的实时反馈来扩展这项工作,目标是最终提供能够增强手术安全性和疗效的认知辅助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →