S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks
Dieses Paper stellt S3-Tracker vor, eine selbstüberwachte Methode, die kontrastive Random Walks auf unbeschrifteten endoskopischen Videos nutzt, um ein robustes Tracking von chirurgischem Gewebe zu erreichen, das mit semi-überwachten Ansätzen vergleichbar ist und somit die Herausforderung der Beschaffung großer annotierter Datensätze für computergestützte Interventionen überwindet.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Im Inneren des menschlichen Körpers ist die Sicht aus einer chirurgischen Kamera oft eine sich verändernde Landschaft aus weichem, feuchtem Gewebe, das sich unter dem Druck von Instrumenten dehnt, faltet und verschiebt. Für Chirurgen und die Roboter, die sie unterstützen, ist es eine ständige Herausforderung, eine stabile mentale Karte davon aufrechtzuerhalten, wo sich welches Stück Gewebe befindet. Wenn ein Chirurg das, was er auf einem Bildschirm sieht, mit einem präoperativen Scan wie einer CT oder MRT abgleichen muss, wird diese Aufgabe nahezu unmöglich, wenn sich das Gewebe in Echtzeit verformt. Um dies zu lösen, müssen Computer bestimmte Punkte auf dem Gewebe von einem Videoframe zum nächsten verfolgen und so eine kontinuierliche Verbindung zwischen der Live-Ansicht und der internen Anatomie des Patienten aufrechterhalten. Während moderne künstliche Intelligenz bereits sehr gut darin geworden ist, Objekten in Standardvideos zu folgen, hat die chaotische Realität der Chirurgie – geprägt von Blut, Rauch und hochreflektierenden Oberflächen – es schwierig gemacht, Computer zu lehren, dies zuverlässig zu tun, ohne riesige Mengen an menschlich beschrifteten Daten zu benötigen.
Ein Forschungsteam hat eine neue Methode entwickelt, um Computern das Verfolgen von chirurgischem Gewebe beizubringen, ohne auf diese schwer zu beschaffenden Labels angewiesen zu sein. Anstatt dem Computer tausende Videos zu zeigen, in denen Menschen mühsam Punkte und Linien gezeichnet haben, um Bewegungen anzuzeigen, lernt die neue Methode, den S3-Tracker, indem sie das Video selbst beobachtet und ihre eigene Arbeit überprüft. Das System betrachtet das Video als eine Serie verbundener Momente und stellt eine einfache Frage: Wenn ich mich von Punkt A in einem Frame zu Punkt B im nächsten bewege und dann versuche, von B zurück nach A zu gelangen, komme ich dann exakt dort an, wo ich gestartet bin? Indem das System dazu gezwungen wird, diese Frage immer und immer wieder korrekt zu beantworten, lernt es zu verstehen, wie sich Pixel bewegen und verformen, selbst wenn das Gewebe von einem Moment zum nächsten sehr unterschiedlich aussieht. Dieser Ansatz ermöglicht es dem System, aus riesigen Mengen an unbeschriftetem chirurgischem Filmmaterial zu lernen und damit den Engpass zu umgehen, für Experten die Annotation jedes einzelnen Frames vornehmen zu müssen.
Die Forscher bauten ihr System so auf, dass es Paare von Videoframes betrachtet und herausfindet, wie die Pixel in einem Frame mit den Pixeln im nächsten zusammenhängen. Sie nutzen einen Prozess, der eine Karte von Verbindungen zwischen diesen Punkten erstellt und dem Computer im Wesentlichen die wahrscheinlichste Bahn vorgibt, die ein Stück Gewebe genommen hat. Um sicherzustellen, dass der Computer nicht nur zufällig rät, überprüft das System seine eigene Logik, indem es die Bewegung vorwärts und dann rückwärts ausführt. Wenn der Pfad vorwärts und der Pfad rückwärts nicht am selben Ort zusammentreffen, weiß das System, dass es einen Fehler gemacht hat, und passt sein Verständnis an. Dieser Selbstkontrollmechanismus, den die Autoren als „contrastive random walk“ bezeichnen, ermöglicht es dem Modell, die komplexen Arten, wie sich Gewebe dehnt und biegt, zu lernen, ohne jemals eine einzige korrekte Antwort von einem Menschen gesehen zu haben. Das System enthält zudem eine Möglichkeit zu entscheiden, wann ein Punkt nicht mehr sichtbar ist – etwa weil er durch Blut oder ein Instrument verdeckt wurde – und hört auf, ihn zu verfolgen, bis er wieder erscheint, um zu verhindern, dass der Computer verwirrt wird und vom Kurs abkommt.
Bei Tests mit echten chirurgischen Videodatensätzen erwies sich die neue Methode als starker Konkurrent zu bestehenden Systemen, die auf teilweiser menschlicher Beschriftung beruhen. Die Forscher fanden heraus, dass ihr selbstüberwachter Ansatz Punkte mit einer Genauigkeit verfolgen kann, die sich an Methoden mit teilweiser menschlicher Anleitung misst, während er gleichzeitig signifikant schneller in Echtzeit läuft. In Tests, die die Abweichung der vorhergesagten Punkte von der tatsächlichen Grundwahrheit (Ground Truth) maßen, schnitt das System gut genug ab, um als lebensfähig für den klinischen Einsatz betrachtet zu werden, wobei es eine durchschnittliche Genauigkeit von 0,708 über verschiedene Fehlerschwellenwerte hinweg erreichte. Während voll überwachte Modelle, die vollständige menschliche Labels verwenden, manchmal etwas präziser in Bezug auf die reine Fehlerdistanz sein können, sind sie oft zu langsam, um während einer Live-Operation Frame für Frame zu arbeiten. Die neue Methode hingegen arbeitet effizient genug, um mit dem Videostream Schritt zu halten, indem sie Frames mit einer Rate von dreimal pro Sekunde verarbeitet. Diese Geschwindigkeit, kombiniert mit der Fähigkeit, das visuelle Chaos der Chirurgie ohne vorbeschriftete Daten zu bewältigen, deutet darauf hin, dass selbstüberwachtes Tracking zu einem praktischen Werkzeug für die Führung robotergestützter Operationen werden könnte und Chirurgen dabei helfen kann, das komplexe, bewegliche Gelände des menschlichen Körpers zu navigieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.