← Últimos artículos
🤖 machine learning

S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks

Este artículo presenta S3-Tracker, un método autosupervisado que aprovecha caminatas aleatorias contrastivas en videos endoscópicos no etiquetados para lograr un seguimiento de tejido quirúrgico robusto comparable al de los enfoques semisupervisados, superando así el desafío de obtener grandes conjuntos de datos anotados para la intervención asistida por computadora.

Autores originales: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

Publicado 2026-09-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Dentro del cuerpo humano, la vista desde una cámara quirúrgica es a menudo un paisaje cambiante de tejido blando y húmedo que se estira, se pliega y se desliza bajo la presión de los instrumentos. Para los cirujanos y los robots que los asisten, mantener un mapa mental estable de dónde se encuentra cada pieza de tejido es un desafío constante. Si un cirujano necesita hacer coincidir lo que ve en una pantalla con un escaneo preoperatorio, como una TC o una RM, la tarea se vuelve casi imposible cuando el tejido se deforma en tiempo real. Para resolver esto, las computadoras necesitan rastrear puntos específicos en el tejido de un fotograma de video al siguiente, manteniendo una conexión continua entre la vista en vivo y la anatomía interna del paciente. Si bien la inteligencia artificial moderna se ha vuelto bastante buena siguiendo objetos en videos estándar, la realidad desordenada de la cirugía —llena de sangre, humo y superficies altamente reflectantes— ha dificultado la enseñanza de cómo hacer esto de manera confiable sin cantidades masivas de datos etiquetados por humanos.

Un equipo de investigadores ha desarrollado una nueva forma de enseñar a las computadoras a rastrear el tejido quirúrgico sin necesidad de esas etiquetas difíciles de obtener. En lugar de mostrar a la computadora miles de videos donde los humanos han dibujado meticulosamente puntos y líneas para mostrar el movimiento, el nuevo método, llamado S3-Tracker, aprende observando el video por sí mismo y revisando su propio trabajo. El sistema trata el video como una serie de momentos conectados y se hace una pregunta simple: si me muevo del punto A en un fotograma al punto B en el siguiente, y luego intento moverme de regreso de B a A, ¿termino exactamente donde comencé? Al obligar a la computadora a responder esta pregunta correctamente una y otra vez, aprende a entender cómo se mueven y deforman los píxeles, incluso cuando el tejido se ve muy diferente de un momento a otro. Este enfoque permite que el sistema aprenda de vastas cantidades de metraje quirúrgico no etiquetado, evitando el cuello de botella de necesitar expertos humanos para anotar cada fotograma.

Los investigadores construyeron su sistema para observar pares de fotogramas de video y determinar cómo se relacionan los píxeles de uno con los del siguiente. Utilizan un proceso que crea un mapa de conexiones entre estos puntos, esencialmente pidiéndole a la computadora que adivine la trayectoria más probable que tomó un trozo de tejido. Para asegurarse de que la computadora no esté simplemente adivinando al azar, el sistema verifica su propia lógica ejecutando el movimiento hacia adelante y luego hacia atrás. Si la trayectoria hacia adelante y la trayectoria hacia atrás no se encuentran en el mismo lugar, el sistema sabe que cometió un error y ajusta su comprensión. Este mecanismo de autocontrol, que los autores llaman un paseo aleatorio contrastivo, permite que el modelo aprenda las formas complejas en que el tejido se estira y se dobla sin haber visto nunca una sola respuesta correcta proporcionada por un humano. El sistema también incluye una forma de decidir cuándo un punto ya no es visible, tal vez porque ha sido cubierto por sangre o un instrumento, y deja de rastrearlo hasta que reaparece, evitando que la computadora se confunda y se desvíe del curso.

Al ser probado en conjuntos de datos de video quirúrgico real, el nuevo método demostró ser un fuerte contendiente contra los sistemas existentes que dependen de un etiquetado humano parcial. Los investigadores encontraron que su enfoque de aprendizaje supervisado por sí mismo podía rastrear puntos con una precisión que rivaliza con los métodos entrenados con algo de guía humana, siendo significativamente más rápido de ejecutar en tiempo real. En las pruebas que medían qué tan alejados estaban los puntos predichos de la verdad de terreno real, el sistema funcionó lo suficientemente bien como para ser considerado viable para uso clínico, logrando una puntuación de precisión promedio de 0.708 a través de varios umbrales de error. Aunque los modelos totalmente supervisados, que utilizan etiquetas humanas completas, pueden ser a veces ligeramente más precisos en términos de distancia de error bruta, a menudo son demasiado lentos para trabajar fotograma a fotograma durante una cirugía en vivo. El nuevo método, por el contrario, opera con la eficiencia suficiente para mantenerse al día con la transmisión de video, procesando fotogramas a una tasa de tres veces por segundo. Esta velocidad, combinada con su capacidad para manejar el caos visual de la cirugía sin necesidad de datos preetiquetados, sugiere que el rastreo autosupervisado podría convertirse en una herramienta práctica para guiar la cirugía robótica y ayudar a los cirujanos a navegar por el complejo y móvil terreno del cuerpo humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →