Surgical Visual Understanding (SurgVU) Dataset
本文介绍了手术视觉理解(SurgVU)数据集,这是一个包含机器人辅助手术视频及其配套标注的大规模集合,旨在推动手术数据科学中的基础研究并解决多样化的机器学习挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教机器人如何烹饪一顿复杂的菜肴,但你没有给它食谱,而是直接递给它一千个小时的录像,录像中是一位主厨在切菜、搅拌和摆盘。这篇论文所做的正是如此,只不过对象是手术。
来自直觉外科(Intuitive Surgical)的这支团队发布了一个名为SurgVU 数据集的全新大型“图书馆”。请将此不仅仅视为视频集合,而应将其看作一本为计算机编写的、组织严密的大型教科书,旨在帮助它们理解机器人手术期间人体内部发生的情况。
以下是他们构建内容的分解说明,采用简单的类比:
1. “原材料”(数据)
团队录制了超过840 小时的视频。为了让你有个概念,如果你不间断地观看这些视频,需要整整近两个月的时间。
- 场景:这些并非在真实患者身上进行的手术,而是训练课程。外科医生使用 da Vinci 机器人系统,在猪组织(猪模型)上进行练习。
- 质量:视频为高清,并以每秒 60 帧的速率录制。这产生了约1800 万张单帧图像,供计算机研究。
- 来源:这就像手术的“飞行模拟器”,但不同于仅记录飞行员的视角,他们还精确记录了飞行员(即外科医生)手持的工具以及他们尝试执行的机动动作。
2. “标签”(注释)
原始视频对计算机来说难以理解。它需要“标签”或标记来知道自己在看什么。作者添加了三种主要类型的标记:
- 工具标签(厨具):就像厨房里有勺子、刀和打蛋器一样,手术机器人也有针持、剪刀和抓钳等工具。该数据集会告知计算机画面中出现了哪种工具以及出现的时间。
- 难点:有时工具会被组织或机器人手臂遮挡,导致计算机可能产生混淆。作者承认这些标签可能有点“噪声”(不完美),但这实际上为研究人员提供了一个极佳的挑战去解决。
- 步骤标签(食谱步骤):数据被分解为具体的“动作”,例如“缝合”(打结)或“牵拉”(将组织拉开)。共有八个主要的步骤类别。
- 故事标签(解说):这是最新的补充。对于每一个步骤,都有一段文字描述,精确解释正在发生什么。这就像有一位旁白在说:“外科医生现在切换到 30 度摄像头并抓取结肠。”这有助于计算机学习将“所见”与“所读”联系起来。
3. “模拟测试”(验证集)
为了确保计算机确实在学习而不是仅仅在猜测,团队提供了一个独立的“测验”。这是一组较小的视频,其中的工具被方框标记(就像“威利在哪里”游戏)。这使得研究人员能够测试他们的算法,看它们是否能正确识别视频中的工具。
4. “原因”(目标)
作者并非仅仅在 dumping 数据;他们是在邀请整个计算机科学界参与。他们希望解决特定的难题,例如:
- 实时指导:计算机能否观察手术并告诉外科医生:“嘿,你快要切到神经了”?
- 无师自通:即使标签不完美,计算机能否自行推断出步骤?
- 技能评分:计算机能否观察外科医生,并评估其手部稳定性给出评分?
- 视频转文本:计算机能否观看一段剪辑并撰写事件摘要?
核心结论
将 SurgVU 数据集想象成一个巨大的共享游乐场。在此之前,只有直觉外科内部的人员才能访问如此大量的数据。现在,他们敞开了大门。他们希望,通过为研究人员提供一个共同的练习场所,能够加速发明更智能、更安全、更有帮助的机器人手术工具。
他们明确指出,这是迄今为止最大的公开可用手术视频数据集,并希望它成为该领域所有未来研究的“黄金标准”或“试金石”,以此作为衡量基准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。