← 最新论文
🤖 machine learning

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

本文介绍了一个全面的多模态真实手术室录像数据集,该数据集整合了标准化的团队协作评估、多层级交互标注以及针对替代结果的新颖反事实描述,旨在为手术团队动态的高级计算建模以及人工智能辅助协作系统的开发提供支持。

原作者: Vincenzo Marco De Luca, Antonio Longa, Andrea Passerini

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincenzo Marco De Luca, Antonio Longa, Andrea Passerini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:迈向可操作的术中团队动态研究

问题陈述
在手术室(OR)等高风险环境中,有效的团队协作对于患者安全至关重要,这高度依赖于非技术技能,如沟通、协调和情境意识。尽管近期的手术数据科学进展已经产生了多模态数据集(例如 Cholec80, MM-OR),但这些资源主要侧重于视觉场景理解、手术阶段识别和动作检测。它们缺乏对团队层面现象的集成表示,例如特定说话人的对话结构、非技术技能评估以及交互中断的动态过程。此外,现有的数据集通常在模态和标注方案上呈现碎片化,且很少能为“为什么团队表现会下降”提供解释性见解。目前的计算模型往往将团队表现简化为单一的分数,忽视了个人、人际与集体过程之间复杂的相互作用,并且无法提供临床环境中建立信任和进行干预所需的解释性说明。

方法论
作者提出了对公开可用的 MM-OR 数据集的全面扩展,该数据集包含同步的多模态记录,涵盖了机器人膝关节置换手术过程。该方法论包含三个主要的的技术组成部分:

  1. 多模态增强流水线:

    • 说话人日志划分(Speaker Diarization): 对说话人轮次进行人工精修,以确保在嘈杂的手术室环境中实现高时间精度,从而能够分析轮次转换、中断和参与度平衡。
    • 双语转录: 创建对齐的德语(原始语言)和英语转录文本,以促进标注审查和跨语言建模。
    • 数据结构: 该资源保持了硬件同步的模态,包括 5 个 RGB-D 摄像头、3 个 RGB 摄像头、3 个麦克风、机器人日志和 3D 追踪,所有数据均以 1 FPS 的频率对齐。
  2. 多层级标注框架:
    作者引入了一个层次化的标注模式,涵盖了由三位专家使用既定框架对 169 个六分钟视频片段进行的标注:

    • 团队层面: 利用 OTAS(手术观察团队评估)对五个维度(沟通、协调、合作、领导力、监控)进行 0–6 级的 Likert 量表评分。
    • 交互层面: 针对仅有人类参与的团队改编了 HMT(人机协作)框架,用于评估五个宏观类别(沟通、共同信息处理、协调、人际关系、动机)下的两两交互。
    • 个人层面:
      • 动态维度: 使用 NOTSS(外科医生非技术技能)评估情境意识、决策制定、沟通/团队协作和领导力。
      • 静态/稳定维度: 集成 BFTQ(团队中的大五人格)、SYMLOG(领导力/人际行为)和 GLIS(通用领导力印象量表)来捕捉稳定的特质和涌现的领导力。
  3. 反事实标注层:
    这是一个新颖的贡献,标注者需识别出对段落内团队协作产生最负面影响的具体事件或行为。这些标注包括:

    • 时间间隔: 触发事件的持续时长。
    • 归因: 识别受影响的团队维度及责任主体。
    • 质量评分: 在五个维度上进行 1–5 级的序数级评估:关键性(对表现的影响)、合理性(替代方案的现实程度)、置信度(标注者的确定性)、极小化(改变的充分性)以及预期提升(潜在的性能增益)。
    • 原理说明: 描述事件、后果及建议替代行为的文本解释。

核心贡献

  • 增强型多模态数据集: 首个结合了原始多模态信号与手工构建的说话人感知及语言感知表示(日志划分和双语转录)的公开手术室数据集。
  • 多层级标注框架: 一个统一的资源,通过多种经过验证的理论框架(OTAS, HMT, NOTSS, BFTQ, SYMLOG, GLIS)同时提供团队层面、交互层面和个人层面的评估。
  • 反事实标注协议: 一个捕捉团队表现下降解释性信号的新颖层,它超越了描述性分数,能够识别具体的行为触发因素和合理的替代结果。
  • 基准任务: 本文为三个不同的研究方向建立了基准性能:
    1. 特征增强: 实证评估并量化基于说话人感知和基于转录本表示的效用,证明它们提供了互补信息,并能比仅使用原始音频/视觉特征更好地预测团队表现。
    2. 多层级预测: 表明时序关系架构(特别是 TE-ReNN)在预测各级标注维度方面优于静态模型和纯时序模型。
    3. 反事实检测: 证明多模态信号包含识别与团队协作下降相关的事件的预测模式,其性能显著高于随机水平。

结果

  • 标注分布: 数据集呈现出中度的类别不平衡,大多数评分集中在中间到正向的分数(例如,62.7% 的片段在 OTAS 沟通维度上评分为 4 或 5),反映出所记录的手术过程中团队表现总体称职但并非卓越。
  • 反事实洞察: 约 70% 的反事实事件与沟通、监控或合作失败有关。大多数事件归因于单个行动者(平均 1.3 个行动者),且关键性和置信度得分普遍处于中低水平,表明标注者认为这些是中度的效率低下而非灾难性的失败。
  • 模型性能:
    • 特征影响: 利用日志划分和转录本的模型表现始终优于仅使用原始音频和计算机视觉特征的模型。
    • 架构: TE-ReNN(时序关系神经网络)在所有任务中均取得了最高的 F1-macro 分数(例如,OTAS 为 74.2%,BFTQ 为 76.7%),证实了联合建模时序演化和人际依赖对于手术团队分析至关重要。
    • 反事实检测: 尽管事件较为罕见,模型仍实现了远高于随机水平的 F1-macro 分数,验证了这些解释性信号的可学习性。

意义与主张
本文声称将手术数据科学的范式从纯粹的描述性工作流建模转向集成、多模态且可解释的团队动态建模。通过提供一个将原始传感器数据与高层社会构念及反事实解释相联系的统一资源,这项工作实现了:

  • 研究个人行为与交互模式如何共同影响团队成果。
  • 开发能够识别团队协作崩溃并提出改进建议的 AI 辅助协作系统。
  • 为高风险领域的预测建模和行为分析奠定基础。

作者谦虚地承认,反事实标注代表的是专家对合理替代方案的判断,而非经过实验验证的因果机制。他们还指出,对人工标注的依赖限制了可扩展性,并建议未来的工作可以探索半自动化流水线。尽管如此,该资源被定位为迈向以人为本、具备解释性的手术团队 AI 的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →