← Neueste Arbeiten
💻 computer science

A generalizable foundation model for intraoperative understanding across surgical procedures

Die Studie stellt ZEN vor, ein generalisierbares Fundamentmodell für das intraoperative Videoverständnis, das durch Selbstüberwachung auf über 4 Millionen Bildern aus mehr als 21 Eingriffen trainiert wurde und in verschiedenen Szenarien sowie über verschiedene chirurgische Verfahren hinweg eine überlegene Leistung und Generalisierungsfähigkeit im Vergleich zu bestehenden Modellen zeigt.

Ursprüngliche Autoren: Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

Veröffentlicht 2026-02-17
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie schauen sich einen chirurgischen Eingriff an, bei dem der Chirurg durch ein kleines Loch in der Bauchdecke mit einer Kamera arbeitet (minimal-invasive Chirurgie). Für einen Laien sieht das oft aus wie ein chaotischer Tanz aus Instrumenten und rotem Fleisch. Selbst für erfahrene Chirurgen kann es schwierig sein, in Echtzeit zu erkennen, was genau passiert, da die Sicht eingeschränkt ist und jeder Arzt seine eigenen Gewohnheiten hat.

Genau hier kommt die neue Forschung mit dem Namen ZEN ins Spiel. Hier ist die Erklärung, wie ein einfacher, kreativer Vergleich:

1. Das Problem: Der "Einzelkämpfer"

Bisher gab es viele kleine KI-Modelle, die wie Spezialisten waren.

  • Ein Modell konnte nur erkennen, wann eine Operation beginnt und endet (wie ein Uhrmacher).
  • Ein anderes Modell konnte nur zählen, wie viele Instrumente im Bild sind (wie ein Zähler).
  • Ein drittes Modell konnte nur beschreiben, was zu sehen ist (wie ein Dolmetscher).

Das Problem: Wenn Sie einen neuen Chirurgen oder eine neue Art von Operation hatten, versagten diese Spezialisten oft. Sie waren zu starr und konnten sich nicht anpassen. Es fehlte an einem "Allrounder".

2. Die Lösung: ZEN, der "Super-Lernende"

ZEN ist keine gewöhnliche KI, sondern ein Grundlagenmodell (Foundation Model). Man kann es sich wie einen Medizinstudenten vorstellen, der nicht nur ein Fach gelernt hat, sondern die gesamte Medizin studiert hat.

  • Der riesige Lehrplan: Statt nur ein paar Videos zu sehen, hat ZEN über 4,3 Millionen Bildschirmausschnitte aus mehr als 21 verschiedenen Operationen studiert. Das ist, als würde ein Schüler 10.000 Bücher lesen, bevor er zur Schule geht.
  • Der Lernprozess (Selbstüberwachtes Lernen): ZEN hat nicht gelernt, indem ihm jemand gesagt hat: "Das ist eine Schere." Stattdessen hat er selbst Muster erkannt, indem er die Videos immer wieder angesehen und versucht hat, die Zusammenhänge selbst zu verstehen. Er hat gelernt, wie Gewebe aussieht, wie Instrumente sich bewegen und wie eine Operation abläuft, ohne dass ihm jemand bei jedem Schritt die Hand geführt hat.

3. Der Trick: Die "Lehrer-Schüler"-Methode

Das Besondere an ZEN ist, wie es trainiert wurde. Die Forscher haben nicht einfach nur ein Modell gebaut. Sie haben zwei Meister-Lehrer (Expert-Modelle) genommen:

  1. Lehrer A: Ein Experte für räumliches Sehen (er weiß genau, wo was ist).
  2. Lehrer B: Ein Experte für Sprache und Bilder (er versteht, was im Bild passiert und kann es beschreiben).

ZEN ist der Schüler. Statt nur einen Lehrer zu haben, hat ZEN beide gleichzeitig als Lehrer. Er schaut zu, wie Lehrer A die Bilder analysiert, und wie Lehrer B die Bilder mit Worten verbindet. Dann versucht ZEN, beides in sich zu vereinen.

  • Das Ergebnis: ZEN hat die Stärken beider Lehrer geerbt. Er kann nicht nur sehen, was passiert, sondern auch verstehen, warum es passiert, und sogar Fragen dazu beantworten.

4. Was kann ZEN jetzt? (Die Superkräfte)

Weil ZEN so breit ausgebildet wurde, kann er fast alles, was ein Chirurg im Kopf hat:

  • Der Chronist: Er kann sagen, in welchem Schritt der Operation man gerade ist (z. B. "Jetzt wird die Gallenblase entfernt").
  • Der Detektiv: Er erkennt winzige Details, wie welche Schere gerade benutzt wird und was sie tut.
  • Der Trainer: Er kann beurteilen, ob ein Chirurg sicher arbeitet (z. B. "Hat der Chirurg alles richtig freigelegt?").
  • Der Dolmetscher: Wenn Sie ihm eine Frage stellen ("Wie viele Instrumente sind zu sehen?" oder "Was macht der Chirurg gerade?"), kann er antworten – sogar auf Deutsch oder Englisch, ohne dass er dafür extra für diese Frage trainiert wurde.
  • Der 3D-Denker: Er kann sogar abschätzen, wie tief die Instrumente im Körper sind, obwohl es nur ein 2D-Bild ist.

5. Warum ist das wichtig?

Stellen Sie sich vor, Sie wollen einen neuen Chirurgen ausbilden. Früher musste er Jahre lang Videos ansehen, um ein Gefühl für die Operation zu bekommen. Mit ZEN könnte man eine intelligente Brille bauen, die dem Chirurgen in Echtzeit sagt: "Achtung, hier ist ein Blutgefäß" oder "Du bist jetzt im Schritt X".

Da ZEN so gut verallgemeinern kann, funktioniert er nicht nur in einer Klinik, sondern auch in einer ganz anderen, mit anderen Geräten oder bei anderen Operationen. Er ist wie ein universeller chirurgischer Assistent, der sich schnell an jede neue Situation anpasst.

Zusammengefasst:
ZEN ist der erste "Allrounder" für chirurgische Videos. Er wurde mit einem riesigen Datensatz trainiert, hat von zwei spezialisierten KI-Lehrern gelernt und ist jetzt in der Lage, Operationen zu verstehen, zu beschreiben und zu bewerten – ähnlich wie ein erfahrener Chirurg, der aber nie müde wird und unendlich viel Wissen gespeichert hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →