← Nieuwste papers
💻 computer science

Fine-Tuned Foundation Models for Multi-Category Segmentation and Triplet Recognition in Gastric Cancer Surgery

Deze studie presenteert een via fine-tuning verfijnde foundation model-aanpak die gebruikmaakt van een nieuw samengestelde dataset van 2.909 geannoteerde frames om een hoge nauwkeurigheid te bereiken bij de semantische segmentatie van chirurgische instrumenten en anatomie, evenals een robuuste herkenning van chirurgische actie-triplets, waardoor intraoperatieve begeleiding en automatische vaardigheidsbeoordeling bij maagkankerschirurgie worden geavanceerd.

Oorspronkelijke auteurs: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

Gepubliceerd 2026-09-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Binnen het menselijk lichaam is de maag een complex landschap van zacht weefsel, bloedvaten en delicate organen, die allemaal in een nauwe ruimte zijn gepakt. Wanneer chirurgen een kankermaaf verwijderen, moeten ze dit ingewikkelde milieu met extreme precisie navigeren, vaak met behulp van lange, dunne instrumenten die via kleine incisies worden ingebracht. Dit is een taak met hoge inzet waarbij één enkele uitschieter ernstige schade kan veroorzaken. Decennialang vertrouwde de oplossing volledig op de ogen en ervaring van de chirurg, maar een nieuw wetenschappelijk veld probeert hen een digitale tweede paar ogen te geven. Dit veld gebruikt kunstmatige intelligentie om chirurgische video's te bekijken en te leren herkennen wat er in realtime gebeurt. Het kernidee is simpel: als een computer kan worden geleerd het verschil te zien tussen een chirurgisch instrument en een vitaal orgaan, of precies kan begrijpen wat een chirurg op elk gegeven moment doet, zou het de chirurg uiteindelijk kunnen waarschuwen voor gevaar voordat er een fout optreedt. Dit vereist dat machines worden geleerd niet alleen vormen te zien, maar ook het verhaal van de operatie te begrijpen terwijl deze zich ontvouwt.

Een team van onderzoekers heeft een belangrijke stap richting dit doel gezet door een gespecialiseerde bibliotheek van chirurgische momenten te creëren en een computer te leren deze te lezen. Ze richtten zich op maagkankerschirurgie, een procedure die bekend staat om zijn moeilijkheidsgraad en het hoge risico op complicaties. Het team verzamelde bijna drieduizend videoframes van echte operaties, waarbij zowel traditionele laparoscopische methoden als nieuwere robotgestuurde technieken werden vastgelegd. Vanuit deze beelden hebben ze handmatig gedetailleerde contouren getrokken rond elk chirurgisch instrument en elke zichtbare anatomische structuur, zoals de maag, bloedvaten en lymfeklieren. Ze labelden ook de interacties tussen deze elementen, waardoor een gestructureerd verslag ontstond van welk instrument werd gebruikt, welke actie het uitvoerde en welk weefsel het raakte. Deze enorme inspanning resulteerde in een dataset met bijna negentienduizend afzonderlijke annotaties, wat een rijke, gedetailleerde kaart van het chirurgische veld bood die eerder ontbrak.

Met deze nieuwe bibliotheek in handen testten de onderzoekers een krachtig type kunstmatige intelligentie dat bekend staat als een foundation model. Denk aan dit model als een student die al miljoenen medische afbeeldingen heeft bestudeerd en algemene regels over hoe weefsels en instrumenten eruitzien geleerd heeft, in plaats van een student die vanaf nul begint. De onderzoekers hebben deze vooraf getrainde student specif으로 verfijnd om zich te concentreren op de video's van de maagchirurgie. Ze vroegen de computer twee taken uit te voeren: eerst het trekken van precieze grenzen rond instrumenten en organen, en ten tweede het identificeren van de specifieke combinaties van instrumenten, acties en doelen die in de video plaatsvinden. Ze vergeleken deze geavanceerde aanpak met een meer traditionele, eenvoudigere computer vision-methode om te zien welke de complexiteit van de echte wereld beter kon aanpakken.

De resultaten toonden aan dat het geavanceerde foundation model superieur was in de taak van het zien en omlijnen. Wanneer het model werd gevraagd om chirurgische instrumenten te identificeren, kwam het de vorm van het instrument in meer dan negentig procent van de gevallen correct overeen met de afbeelding. Bij het identificeren van anatomische structuren zoals de maag of bloedvaten behaalde het een succespercentage van bijna negentig procent. In tegen tegenstelling hiertoe worstelde de traditionele methode aanzienlijk, waarbij vaak gefragmenteerde of onvolledige contouren ontstonden die cruciale details misten. De onderzoekers ontdekten dat het geavanceerde model de rommelige realiteit van chirurgie — waarbij instrumenten soms verborgen zijn door bloed of rook — veel beter kon aan kunnen dan de oudere technologie. Dit suggereert dat de voorkennis van het foundation model over medische afbeeldingen het een duidelijk voordeel gaf bij het snel en nauwkeurig leren van de specifieke nuances van maagchirurgie.

De tweede taak, het herkennen van de specifieke acties die plaatsvinden, bleek uitdagender maar nog steeds veelbelovend. De onderzoekers vroegen de computer om de "triplet" van elke gebeurtenis te voorspellen: het instrument, de actie en het doel. Bijvoorbeeld, het systeem moest begrijpen dat een specifiek instrument een stuk vetweefsel aan het snijden was. Hoewel de computer nog niet perfect was, presteerde hij aanzienlijk beter dan eerdere pogingen tot soortgelijke taken. De analyse toonde aan dat de computer het meest betrouwbaar was bij het herkennen van de actie zelf, zoals snijden of trekken, terwijl hij iets minder accuraat was bij het identificeren van exact welk instrument of welk specifiek orgaan betrokken was. Dit komt waarschijnlijk doordat de dataset veel veelvoorkomende acties bevatte maar slechts weinig voorbeelden van zeldzame, complexe manoeuvres. De onderzoekers merkten op dat de moeilijkste gevallen betrokken bij zeldzame instrumenten of specifieke anatomische doelen die slechts een handvol keren in de data voorkwamen, wat benadrukt dat het systeem nog meer blootstelling nodig heeft aan deze ongewone scenario's om volledig robuust te worden.

De studie concludeert dat hoewel de technologie nog niet klaar is om een operatie zelfstandig uit te voeren, het een niveau van nauwkeurigheid heeft bereikt dat het een levensvatbaar fundament maakt voor toekomstige veiligheidstools. De onderzoekers benadrukken dat de werkelijke waarde van dit werk niet ligt in de cijfers zelf, maar in wat ze mogelijk maken: een systeem dat op een dag een operatie zou kunnen observeren en een chirurg zou kunnen waarschuwen als een instrument te dicht bij een vitale slagader is of als een kritieke stap onjuist wordt uitgevoerd. Het team erkent dat hun werk gebaseerd is op gegevens van één enkel ziekenhuis en dat de modellen nog steeds getest moeten worden bij verschillende chirurgen en apparatuur om te garanderen dat ze overal werken. Echter, door te bewijzen dat deze geavanceerde modellen de complexe visuele taal van maagchirurgie kunnen begrijpen, biedt de studie het essentiële technische fundament voor de bouw van de volgende generatie chirurgische begeleidingssystemen die op een dag levens kunnen redden door fouten te voorkomen voordat ze gebeuren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →