← Nieuwste papers
💻 computer science

A generalizable foundation model for intraoperative understanding across surgical procedures

Deze paper introduceert ZEN, een generaliseerbaar fundamenteel model dat is getraind op meer dan 4 miljoen frames van 21 chirurgische ingrepen en dat consistent betere prestaties levert dan bestaande modellen voor het begrijpen van chirurgische video's, waardoor het een stap is naar uniforme representaties voor intraoperatieve assistentie en training.

Oorspronkelijke auteurs: Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

Gepubliceerd 2026-02-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Super-Chirurg" die alles kan zien: Een uitleg van het ZEN-model

Stel je voor dat een chirurg in een operatiekamer werkt als een piloot in een vliegtuig. Ze moeten razendsnel beslissingen nemen op basis van wat ze zien op een klein scherm (de endoscoop). Maar hier zit een probleem: elke piloot (chirurg) heeft een eigen stijl, en wat voor de één duidelijk is, is voor de ander vaag. Bovendien zijn er duizenden verschillende soorten operaties, en tot nu toe waren de slimme computers (AI) die hen zouden moeten helpen, maar gespecialiseerd in één ding. Ze waren als een auto die alleen op de snelweg kan rijden, maar niet op een landwegje.

De onderzoekers in dit paper hebben ZEN bedacht. ZEN is geen gewone computer, maar een "basis-model" (een foundation model) dat is opgeleid om alles te begrijpen wat er in een operatiekamer gebeurt.

Hier is hoe het werkt, vertaald in alledaagse taal:

1. De enorme bibliotheek (De training)

Om ZEN slim te maken, hebben de onderzoekers niet één boek gelezen, maar een hele bibliotheek van 4,3 miljoen beelden uit meer dan 4.700 video's.

  • De analogie: Stel je voor dat je een kind wilt leren wat een hond is. Je kunt één foto laten zien, of je kunt het kind 4 miljoen foto's van honden, katten, auto's en bomen laten zien, uit verschillende hoeken en met verschillende lichtjes.
  • ZEN heeft dit gedaan. Het heeft video's gezien van 21 verschillende soorten operaties (van galblaasverwijdering tot maagoperaties) en 10 verschillende organen. Hierdoor heeft het een "gevoel" ontwikkeld voor hoe een operatie eruitziet, ongeacht wie de chirurg is of welk instrument er wordt gebruikt.

2. De "Super-Leraar" methode (Multi-teacher distillation)

Dit is het slimste stukje van de uitvinding. Meestal leer je een AI met één methode. Maar ZEN is opgeleid met een meester-leraar-systeem.

  • De analogie: Stel je voor dat je een student wilt opleiden tot topchirurg. Je geeft die student niet één leraar, maar twee:
    1. De Visuele Expert: Een leraar die fantastisch is in details zien (zoals: "Dat is een schaar, dat is een lever").
    2. De Taalkundige Expert: Een leraar die fantastisch is in begrijpen wat er gezegd wordt en hoe dat samenhangt met wat je ziet (zoals: "De chirurg zegt 'nabewerken', dus hij stopt het bloed").
  • ZEN leert van beide leraren tegelijk. Het combineert het scherpe oog van de eerste leraar met het taalbegrip van de tweede. Het resultaat is een model dat niet alleen ziet, maar ook begrijpt wat er gebeurt.

3. Wat kan ZEN nu eigenlijk?

ZEN is als een Zwitserse zakmes voor chirurgie. Het kan veel meer dan alleen kijken:

  • Het ziet de stappen: Het weet precies in welke fase van de operatie de chirurg zit (bijvoorbeeld: "Nu wordt de lever losgemaakt").
  • Het herkent de gereedschappen: Het ziet welke tool in welke hand zit en wat die doet.
  • Het schat diepte in: Omdat operatievideo's plat zijn, moet ZEN slim zijn om te weten hoe diep iets ligt (alsof het een 3D-bril opzet).
  • Het praat mee: Als je vraagt: "Hoeveel instrumenten zie je?" of "Wat is het doel van deze actie?", kan ZEN het antwoord geven in gewone taal.

4. Waarom is dit zo belangrijk?

Vroeger moest je voor elke nieuwe operatie een nieuwe AI bouwen, en die werkte vaak niet goed als je de camera iets anders hield of een andere chirurg gebruikte.

  • De analogie: Het is alsof je vroeger een sleutel nodig had voor elke deur in je huis. Als je verhuisde, mocht je alle sleutels opnieuw maken. ZEN is als een meestersleutel die bij bijna elke deur past, zelfs als je nog nooit in dat specifieke huis bent geweest.
  • ZEN werkt zelfs als je maar heel weinig voorbeelden hebt (bijvoorbeeld maar 1 of 5 video's om het te leren). Dat is cruciaal, want in de medische wereld is het moeilijk om duizenden gelabelde video's te vinden.

Conclusie

ZEN is een grote stap naar een toekomst waar AI chirurgische teams helpt om veiliger en sneller te werken. Het is niet alleen een camera die kijkt, maar een slimme assistent die de taal van de operatiekamer spreekt, ongeacht welke operatie er wordt uitgevoerd. Het maakt de weg vrij voor AI die echt meedenkt in de operatiekamer, in plaats van alleen maar naar een scherm te staren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →