SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary
本文介绍了 SurgOnAir,这是一种基于分层数据集训练的实时流式视觉 - 语言模型,能够在无法访问未来帧的情况下生成即时、多层级的手术叙述并检测工作流程转换,从而为手术室提供即时的人工智能辅助。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位外科医生正在进行一台复杂的手术。在局外人看来,这或许像是一场工具与组织混乱的舞蹈。但对外科医生而言,这是一段高度结构化的叙事,有开头、中间和结尾,被分解为章节、场景和具体的台词。
本文介绍了SurgOnAir,一种专为这段叙事充当“现场解说员”的新型人工智能系统。其工作原理如下,简明扼要:
问题:“倒带”按钮并不存在
大多数现有的手术描述人工智能系统,就像一位观看完整部电影后才暂停、深思良久并撰写影评的影评人。等到影评出炉时,电影早已结束。
在真实的手术室中,你无法等待人工智能看完整个视频后再开口。如果人工智能反应迟缓,它就会错过外科医生切开特定动脉或移动工具的瞬间。这就像试图在足球比赛结束后才进行赛后解说。
解决方案:现场广播员
SurgOnAir 则截然不同。它就像一位体育广播员,在赛事进行的同时进行解说,一旦看到动作便立即说出话语。
- 不倒带:它随着视频流逐帧处理,从不查看“未来”(即视频中接下来发生的内容)。
- 即时反应:一旦新的视觉帧到达,人工智能会立即生成一两个词的解说。
核心秘诀:“目录”
SurgOnAir 的真正魔力不仅在于其速度,更在于它理解手术的层级结构。
想象一本书。
- 章节对应阶段(例如,“切除胆囊”)。
- 场景对应步骤(例如,“切断导管”)。
- 台词对应动作(例如,“用剪刀切断导管”)。
旧的人工智能模型常常迷失方向。它们可能会描述剪刀切割,却未意识到自己处于手术的哪个部分;或者它们可能从“切割”直接跳到“缝合”,而未察觉中间的过渡。
SurgOnAir 内置了一个心理上的“目录”。它不断更新其内部状态:
“好的,我们正处于第 3 章(阶段),第 2 场(场景)。外科医生当前正在执行‘切断导管’(动作)。”
当外科医生完成导管切割并进入下一步时,SurgOnAir 不会只是继续说话;它会生成一个特殊的“过渡标记”。这就像解说员说:“现在,我们进入下一个场景!”这有助于人工智能确切地知道自己在手术流程中的位置,防止其产生混淆或编造事实(幻觉)。
如何训练它(“教科书”)
为了训练这一人工智能,研究人员并非仅仅向其输入随机视频。他们创建了一个名为SurgOnAir-11k的特殊数据集。
- 他们选取了真实的手术视频以及外科医生的语音。
- 他们利用人工智能清理音频,去除诸如“大家好”或“让我解释一下我们为何这样做”等内容,仅保留描述当下正在发生之事的片段(例如,“正在切割动脉”)。
- 他们手动为视频的每一秒标注其阶段、步骤和动作。
这为人工智能提供了一本完美的“教科书”,其中每一个 spoken 的词语都关联着特定的视觉瞬间和手术叙事中的特定位置。
结果:谁赢得了比赛?
研究人员将 SurgOnAir 与其他人工智能模型进行了测试:
- “影评人”(离线模型):这些模型首先观看整个视频。它们速度缓慢,且常常错过现场动作的细微差别。
- “通用广播员”(标准流式模型):这些模型速度很快,但不理解手术的结构。它们可能会描述错误的步骤,或搞错阶段。
- SurgOnAir:由于它理解了层级结构(阶段和步骤)并实时流式处理,它是当之无愧的赢家。它在动作发生的确切时刻描述确切正在发生之事的方面,表现要出色得多。
核心结论
SurgOnAir 是首个能够实时观看手术、同时理解宏观图景(阶段)与微观细节(动作),并在不预看未来的情况下即时进行解说的系统。这就像拥有一位超级聪明的副驾驶,它知晓手术的剧本,并能在你看到动作发生的瞬间,准确告诉你正在发生什么。
注:本文完全聚焦于构建这一实时解说系统及其训练数据集。它并未声称能执行手术本身,或预测当前时刻之外的未来动作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。