← Derniers articles
🤖 machine learning

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

Cet article présente un ensemble de données multimodal complet d'enregistrements réels en salle d'opération qui intègre des évaluations standardisées du travail d'équipe, des annotations d'interactions multi-niveaux et des descriptions contrefactuelles inédites de résultats alternatifs afin de permettre la modélisation computationnelle avancée de la dynamique des équipes chirurgicales et le développement de systèmes collaboratifs assistés par l'IA.

Auteurs originaux : Vincenzo Marco De Luca, Antonio Longa, Andrea Passerini

Publié 2026-08-25
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Vincenzo Marco De Luca, Antonio Longa, Andrea Passerini

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé technique : Vers une dynamique d'équipe chirurgicale exploitable

Énoncé du problème
Le travail d'équipe efficace dans les environnements à enjeux élevés comme les blocs opératoires (BO) est critique pour la sécurité des patients, reposant largement sur des compétences non techniques telles que la communication, la coordination et la conscience de la situation. Bien que les progrès récents de la science des données chirurgicales aient produit des ensembles de données multimodaux (par exemple, Cholec80, MM-OR), ces ressources se concentrent principalement sur la compréhension visuelle de la scène, la reconnaissance des phases procédurales et la détection d'actions. Elles manquent de représentations intégrées des phénomènes au niveau de l'équipe, tels que les structures conversationnelles spécifiques aux locuteurs, les évaluations des compétences non techniques et la dynamique des ruptures d'interaction. De plus, les ensembles de données existants sont souvent fragmentés entre les modalités et les schémas d'annotation, et ils fournissent rarement des informations explicatives sur les raisons pour lesquelles la performance de l'équipe se dégrade. Les modèles computationnels actuels réduisent souvent la performance de l'équipe à un score unique, négligeant l'interaction complexe des processus individuels, interpersonnels et collectifs, et ne parviennent pas à fournir des comptes interprétables nécessaires à la confiance et à l'intervention en milieu clinique.

Méthodologie
Les auteurs proposent une extension complète de l'ensemble de données MM-OR, disponible publiquement, qui contient des enregistrements multimodaux synchronisés de procédures de remplacement de genou par robotique. La méthodologie comprend trois composantes techniques principales :

  1. Pipeline d'enrichissement multimodal :

    • Diarisation des locuteurs : Affinement manuel des tours de parole pour garantir une haute précision temporelle dans l'environnement bruyant du BO, permettant l'analyse de la prise de parole, des interruptions et de l'équilibre de la participation.
    • Transcription bilingue : Création de transcriptions alignées en allemand (original) et en anglais pour faciliter la révision des annotations et la modélisation translinguistique.
    • Structure des données : La ressource maintient des modalités synchronisées matériellement comprenant 5 caméras RGB-D, 3 caméras RGB, 3 microphones, des journaux robotiques et un suivi 3D, le tout aligné à 1 FPS.
  2. Cadre d'annotation multi-niveaux :
    Les auteurs introduisent un schéma d'annotation hiérarchique couvrant 169 clips vidéo de six minutes, annotés par trois experts en utilisant des cadres établis :

    • Niveau Équipe : Utilisation de l'OTAS (Observational Teamwork Assessment for Surgery) pour évaluer cinq construits (Communication, Coordination, Coopération, Leadership, Surveillance) sur une échelle de Likert de 0 à 6.
    • Niveau Interaction : Adaptation du cadre HMT (Human-Machine Teaming) pour les équipes exclusivement humaines afin d'évaluer les interactions par paires à travers cinq macro-catégories (Communication, Traitement conjoint de l'information, Coordination, Relation interpersonnelle, Motivation).
    • Niveau Individuel :
      • Dynamique : Utilisation du NOTSS (Non-Technical Skills for Surgeons) pour évaluer la Conscience de la situation, la Prise de décision, la Communication/Travail d'équipe et le Leadership.
      • Statique/Stable : Intégration du BFTQ (Big-Five-In-Teamwork), du SYMLOG (comportement de leadership/interpersonnel) et du GLIS (General Leadership Impression Scale) pour capturer les traits stables et le leadership émergent.
  3. Couche d'annotation contrefactuelle :
    Une contribution novatrice où les annotateurs identifient les événements ou comportements spécifiques ayant le plus négativement impacté le travail d'équipe au sein d'un segment. Ces annotations incluent :

    • Intervalles temporels : Courtes durées de l'événement déclencheur.
    • Attribution : Identification du construit d'équipe affecté et de l'agent (ou des agents) responsable(s).
    • Évaluations de qualité : Cinq dimensions évaluées sur une échelle ordinale de 1 à 5 : Criticité (impact sur la performance), Plausibilité (réalisme de l'alternative), Confiance (certitude de l'annotateur), Minimalité (suffisance du changement) et Amélioration attendue (gain de performance potentiel).
    • Rationales : Explications textuelles décrivant l'événement, les conséquences et les comportements alternatifs suggérés.

Principales contributions

  • Ensemble de données multimodal enrichi : Le premier ensemble de données public de BO combinant des signaux multimodaux bruts avec des représentations sensibles aux locuteurs et à la langue élaborées à la main (diarisation et transcriptions bilingues).
  • Cadre d'annotation multi-niveaux : Une ressource unifiée fournissant des évaluations simultanées des niveaux équipe, interaction et individuel dérivées de multiples cadres théoriques validés (OTAS, HMT, NOTSS, BFTQ, SYMLOG, GLIS).
  • Protocole d'annotation contrefactuelle : Une couche novatrice capturant des signaux explicatifs pour la dégradation du travail d'équipe, allant au-delà des scores descriptifs pour identifier les déclencheurs comportementaux spécifiques et les résultats alternatifs plausibles.
  • Tâches de référence (Benchmarks) : L'article établit la performance de base pour trois directions de recherche distinctes :
    1. Enrichissement des caractéristiques : Évaluation empirique et quantification de l'utilité des représentations sensibles aux locuteurs et basées sur les transcriptions, démontrant qu'elles fournissent des informations complémentaires et améliorent la prédiction du travail d'équipe par rapport aux caractéristiques audio/visuelles brutes.
    2. Prédiction multi-niveaux : Montrant que les architectures temporelles-relationnelles (spécifiquement TE-ReNN) surpassent les modèles statiques et purement temporels pour prédire les construits à tous les niveaux d'annotation.
    3. Détection contrefactuelle : Prouvant que les signaux multimodaux contiennent des motifs prédictifs pour identifier les événements associés à la dégradation du travail d'équipe, atteignant une performance significativement supérieure au hasard.

Résultats

  • Distribution des annotations : L'ensemble de données présente un déséquilibre de classe modéré, la plupart des évaluations étant concentrées autour de scores intermédiaires à positifs (par exemple, 62,7 % des clips notés 4 ou 5 pour la Communication dans l'OTAS), reflétant des performances d'équipe généralement compétentes mais non exceptionnelles dans les procédures enregistrées.
  • Aperçus contrefactuels : Environ 70 % des événements contrefactuels sont liés à des échecs de communication, de surveillance ou de coopération. La plupart des événements sont attribués à des acteurs uniques (moyenne de 1,3 acteur), et les scores de criticité et de confiance sont généralement faibles à modérés, suggérant que les annotateurs les considéraient comme des inefficacités modérées plutôt que comme des défaillances catastrophiques.
  • Performance des modèles :
    • Impact des caractéristiques : Les modèles utilisant la diarisation et les transcriptions ont systématiquement surpassé ceux n'utilisant que les caractéristiques audio et de vision par ordinateur brutes.
    • Architecture : TE-ReNN (Temporal-Relational Neural Networks) a obtenu les scores F1-macro les plus élevés pour toutes les tâches (par exemple, 74,2 % pour l'OTAS, 76,7 % pour le BFTQ), confirmant que la modélisation conjointe de l'évolution temporelle et des dépendances interpersonnelles est essentielle pour l'analyse du travail d'équipe chirurgical.
    • Détection contrefactuelle : Malgré la rareté des événements, les modèles ont atteint des scores F1-macro bien au-dessus du hasard, validant l'apprentissage de ces signaux explicatifs.

Signification et affirmations
L'article affirme passer du paradigme de la modélisation purement descriptive des flux de travail à une modélisation intégrée, multimodale et explicable de la dynamique d'équipe. En fournissant une ressource unifiée qui lie les données de capteurs brutes aux construits sociaux de haut niveau et aux explications contrefactuelles, ce travail permet :

  • L'étude de la manière dont les actions individuelles et les modèles d'interaction contribuent conjointement aux résultats de l'équipe.
  • Le développement de systèmes collaboratifs assistés par IA capables d'identifier les ruptures de travail d'équipe et de suggérer des améliorations.
  • Un fondement pour la modélisation prédictive et l'analyse comportementale dans des domaines à enjeux élevés.

Les auteurs reconnaissent modestement que les annotations contrefactuelles représentent des jugements d'experts sur des alternatives plausibles plutôt que des mécanismes causaux expérimentés et validés. Ils notent également que la dépendance à l'annotation manuelle limite l'extensibilité, suggérant que les travaux futurs pourraient explorer des pipelines semi-automatisés. Néanmoins, la ressource est positionnée comme une étape critique vers une IA interprétable et centrée sur l'humain pour les équipes chirurgicales.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →