← Derniers articles
🤖 machine learning

S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks

Cet article présente S3-Tracker, une méthode auto-supervisée qui exploite des marches aléatoires contrastives sur des vidéos endoscopiques non étiquetées pour parvenir à un suivi robuste des tissus chirurgicaux comparable aux approches semi-supervisées, surmontant ainsi le défi de l'obtention de grands ensembles de données annotées pour l'intervention assistée par ordinateur.

Auteurs originaux : Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

Publié 2026-09-15
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

À l'intérieur du corps humain, la vue d'une caméra chirurgicale est souvent un paysage changeant de tissus mous et humides qui s'étirent, se replient et glissent sous la pression des instruments. Pour les chirurgiens et les robots qui les assistent, maintenir une carte mentale stable de l'emplacement de chaque fragment de tissu est un défi constant. Si un chirurgien doit faire correspondre ce qu'il voit sur un écran avec un scanner préopératoire, tel qu'un scanner CT ou une IRM, la tâche devient presque impossible lorsque le tissu se déforme en temps réel. Pour résoudre cela, les ordinateurs doivent suivre des points spécifiques sur le tissu d'une image vidéo à la suivante, maintenant une connexion continue entre la vue en direct et l'anatomie interne du patient. Bien que l'intelligence artificielle moderne soit devenue très performante pour suivre des objets dans des vidéos standards, la réalité désordonnée de la chirurgie — remplie de sang, de fumée et de surfaces hautement réfléchissantes — a rendu difficile l'apprentissage pour les ordinateurs de le faire de manière fiable sans de massives quantités de données étiquetées par l'humain.

Une équipe de chercheurs a développé une nouvelle façon d'apprendre aux ordinateurs à suivre les tissus chirurgicaux sans avoir besoin de ces étiquettes difficiles à obtenir. Au lieu de montrer à l'ordinateur des milliers de vidéos où des humains ont méticuleusement dessiné des points et des lignes pour montrer le mouvement, la nouvelle méthode, appelée S3-Tracker, apprend en regardant la vidéo elle-même et en vérifiant son propre travail. Le système traite la vidéo comme une série de moments connectés et pose une question simple : si je passe du point A dans une image au point B dans la suivante, puis que j'essaie de revenir de B vers A, est-ce que je reviens exactement là où j'ai commencé ? En forçant l'ordinateur à répondre correctement à cette question encore et encore, il apprend à comprendre comment les pixels se déplacent et se déforment, même lorsque le tissu semble très différent d'un moment à l'autre. Cette approche permet au système d'apprendre à partir de vastes quantités de séquences chirurgicales non étiquetées, contournant ainsi le goulot d'étranglement que représente la nécessité pour des experts humains d'annoter chaque image.

Les chercheurs ont conçu leur système pour analyser des paires d'images vidéo et déterminer comment les pixels de l'une sont liés aux pixels de l'autre. Ils utilisent un processus qui crée une carte de connexions entre ces points, demandant essentiellement à l'ordinateur de deviner le chemin le plus probable emprunté par un morceau de tissu. Pour s'assurer que l'ordinateur ne fait pas que deviner au hasard, le système vérifie sa propre logique en exécutant le mouvement vers l'avant, puis vers l'arrière. Si le chemin vers l'avant et le chemin vers l'arrière ne se rejoignent pas au même endroit, le système sait qu'il a commis une erreur et ajuste sa compréhension. Ce mécanisme d'auto-vérification, que les auteurs appellent une marche aléatoire contrastive (contrastive random walk), permet au modèle d'apprendre les manières complexes dont le tissu s'étire et se courbe sans jamais voir une seule réponse correcte fournie par un humain. Le système comprend également un moyen de décider quand un point n'est plus visible, par exemple parce qu'il a été couvert par du sang ou un instrument, et cesse de le suivre jusqu'à ce qu'il réapparaisse, empêchant l'ordinateur de s'embrouiller et de dériver hors de sa trajectoire.

Lorsqu'il a été testé sur de véritables ensembles de données de vidéos chirurgicales, la nouvelle méthode s'est révélée être un sérieux concurrent face aux systèmes existants qui reposent sur un étiquetage humain partiel. Les chercheurs ont découvert que leur approche auto-supervisée pouvait suivre des points avec une précision rivalisant avec des méthodes entraînées avec un certain guidage humain, tout en étant nettement plus rapide à exécuter en temps réel. Dans les tests mesurant l'écart entre les points prédits et la réalité du terrain (ground truth), le système a performé suffisamment bien pour être considéré comme viable pour un usage clinique, atteignant un score de précision moyen de 0,708 à travers divers seuils d'erreur. Bien que les modèles entièrement supervisés, qui utilisent des étiquettes humaines complètes, puissent parfois être légèrement plus précis en termes de distance d'erreur brute, ils sont souvent trop lents pour fonctionner image par image lors d'une chirurgie en direct. La nouvelle méthode, en revanche, opère assez efficacement pour suivre le flux vidéo, traitant les images à un rythme de trois fois par seconde. Cette vitesse, combinée à sa capacité à gérer le chaos visuel de la chirurgie sans nécessiter de données pré-étiquetées, suggère que le suivi auto-supervisé pourrait devenir un outil pratique pour guider la chirurgie robotique et aider les chirurgiens à naviguer dans le terrain complexe et mouvant du corps humain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →