← Nieuwste papers
💻 computer science

RARE disease detection from Capsule Endoscopic Videos based on Vision Transformers

Dit artikel beschrijft een op Vision Transformers gebaseerd deep learning-model dat is getraind voor de multi-label classificatie van zeldzame aandoeningen in capsule-endoscopische video's tijdens de Gastro-competitie, hoewel de prestaties op de testset met een mAP van ongeveer 0,02 zeer beperkt bleken.

Oorspronkelijke auteurs: X. Gao, C. Chien, G. Liu, A. Manullang

Gepubliceerd 2026-03-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: X. Gao, C. Chien, G. Liu, A. Manullang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🎥 De "Zwarte Doos" in je Maag: AI op zoek naar zeldzame ziektes

Stel je voor dat je maag en darmen een 9 meter lange, donkere grot zijn. Om te zien wat er daarbinnen gebeurt, moet je een klein cameraatje (een "capsule") doorslikken. Dit cameraatje zwemt door je darmen en maakt in 8 uur tijd ongeveer 50.000 foto's.

Voor een arts is het controleren van die 50.000 foto's als het zoeken naar een naald in een hooiberg, terwijl de naald soms heel erg wazig is. De foto's zijn vaak wazig, hebben belletjes, of er zit voedselresten op. Bovendien moet de arts niet alleen kijken of er iets mis is (zoals een zweer of een bloeding), maar ook weten waar de foto is gemaakt (maag, darm, slokdarm, etc.).

🤖 De Oplossing: Een slimme robot die "kijkt"

Het team MDXBrain (van de Middlesex University in Londen) heeft geprobeerd om een computerprogramma te bouwen dat deze taak voor de arts overneemt. Ze hebben een heel slim type kunstmatige intelligentie gebruikt, genaamd Vision Transformer (ViT).

  • De Analogie: Stel je voor dat een gewone computerprogramma als een kind is dat foto's één voor één bekijkt en probeert te raden wat ze zijn. De Vision Transformer is als een super-intelligente detective die de hele foto in één keer bekijkt, alle details tegelijk analyseert en direct snapt: "Ah, dit is de maag, en daar zit een kleine wond."

⚖️ Het Grote Probleem: De onevenwichtige berg foto's

Er was één groot probleem met de data (de foto's) waar ze mee werkten: het was een enorme onevenwichtige berg.

  • De Vergelijking: Stel je voor dat je een klas hebt met 1.800.000 leerlingen die "Maag" heten, maar slechts 122 leerlingen die "Z-lijn" (een klein deel van de maag) heten. Als je de computer laat leren op deze manier, zal hij alleen maar "Maag" blijven zeggen, omdat dat het vaakst voorkomt. Hij leert de zeldzame dingen nooit.

Hoe hebben ze dit opgelost?
Ze hebben een trucje gebruikt dat ze "semi-supervised random under-sampling" noemen. In gewoon Nederlands: Het "Wegkappen" van de overvloed.

  1. Ze hebben de enorme berg foto's van de veelvoorkomende ziektes (zoals de darm) flink ingekort.
  2. Ze hebben ervoor gezorgd dat ze ongeveer evenveel foto's hadden van de zeldzame dingen als van de gewone dingen (ongeveer 3.000 foto's per ziekte).
  3. De "Gouden" Foto: Ze waren heel voorzichtig met foto's waar veel dingen tegelijk op te zien waren (bijvoorbeeld: darm + maag + bloeding + wond + bloed). Die zijn ze allemaal gaan gebruiken, omdat die het meest waardevol zijn voor het leren van de AI.

🏆 Het Resultaat: Een eerlijk eerlijk begin

Helaas was het resultaat niet perfect. De computer had het erg moeilijk.

  • De score (mAP) was erg laag: 0,0205.
  • De Analogie: Stel je voor dat je een examen doet met 100 vragen. De computer had er maar 2 goed. De rest was gissen.

Waarom zo laag?

  1. De foto's zijn erg wazig en slecht van kwaliteit.
  2. Het is ontzettend moeilijk om in één foto 17 verschillende dingen tegelijk te herkennen (zoals "dit is de maag" én "hier is een bloeding").
  3. De AI heeft waarschijnlijk nog veel meer en betere training nodig.

📝 Conclusie

Dit onderzoek is als het eerste stapje in een lange reis. Het team heeft laten zien dat je een slimme AI (Vision Transformer) kunt gebruiken om naar maagfoto's te kijken en dat je de data moet "schonen" om de AI eerlijk te leren.

Hoewel de computer nu nog niet goed genoeg is om de arts volledig te vervangen, is het een belangrijke eerste stap. Het is als het bouwen van een auto die nog niet rijdt, maar wel de motor heeft die in de toekomst misschien wel de hele weg kan afleggen.

Kort samengevat:

  • Doel: Een computer laten kijken naar maagfoto's om ziektes te vinden.
  • Methode: Slimme AI (Vision Transformer) die foto's herkent.
  • Uitdaging: Er waren veel te veel foto's van de ene ziekte en te weinig van de andere.
  • Oplossing: Ze hebben de "overvloed" weggegooid om een eerlijke balans te maken.
  • Uitkomst: De AI doet het nu nog niet goed, maar het is een waardevolle proef om te zien hoe we dit in de toekomst kunnen verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →