← Nieuwste papers
🤖 machine learning

Spatially Grounded Concept-Based Image Classification

Het artikel stelt SEG-MIL-CBM voor, een ruimtelijk gegrond Concept Bottleneck Model dat afbeeldingen deelt in concept-gestuurde regio's en segment-niveau bewijs aggregeert via aandacht om gelijktijdig de classificatienauwkeurigheid te verbeteren en intrinsieke, menselijk interpreteerbare verklaringen te bieden zonder dat er aparte post-hoc attributiemodules nodig zijn.

Oorspronkelijke auteurs: Ran Eisenberg, Amit Rozner, Ethan Fetaya, Ofir Lindenbaum

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ran Eisenberg, Amit Rozner, Ethan Fetaya, Ofir Lindenbaum

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een rechercheur bent die een mysterie probeert op te lossen: Wat zit er in deze foto?

De meeste moderne AI-rechercheurs (Deep Neural Networks) zijn ongelooflijk goed in het oplossen van de zaak. Ze kunnen je vertellen: "Dat is een vogel!" met 99% nauwkeurigheid. Maar ze zijn verschrikkelijk in het uitleggen hoe ze dat weten. Ze kijken misschien naar de achtergrond (zoals een meer) in plaats van naar de vogel zelf, of ze gebruiken een geheime code die geen mens kan lezen. Als je vraagt: "Waarom zeg je dat het een vogel is?", halen ze alleen maar hun schouders op en zeggen: "Omdat de wiskunde dat zegt."

Andere AI-rechercheurs, genaamd Concept Bottleneck Models (CBMs), proberen eerlijker te zijn. Ze zeggen: "Ik zie een 'snavel' en 'veren', dus het moet wel een vogel zijn." Dit is beter, maar ze hebben nog steeds een gebrek: ze behandelen de hele foto als een smoothie. Ze mengen alle "snavels" en "veren" samen tot één grote beker informatie. Ze kunnen je niet vertellen welk specifiek deel van de foto ze bekijken. Zagen ze de snavel aan de linkerkant? Of de staart aan de rechterkant? Ze geven slechts een globale score.

Maak kennis met de nieuwe detective: SEG-MIL-CBM

De auteurs van dit paper hebben een nieuwe detective gebouwd genaamd SEG-MIL-CBM. Denk aan deze detective als een forensisch accountant die niet alleen gokt, maar ook een gedetailleerd, gespecificeerd bonnetje bijhoudt voor elke beslissing die hij neemt.

Zo werkt het, met behulp van eenvoudige analogieën:

1. Het "Knippen-en-Plakken" Team (Preprocessing)

Voordat de detective zelfs naar de foto kijkt, gebruikt hij een team van gespecialiseerde robots (pre-trained AI-tools zoals CLIP, GroundingDINO en SAM) om de afbeelding in puzzelstukjes te knippen.

  • De Robots: Ze kijken naar de afbeelding en zeggen: "Ik zie een stukje dat lijkt op een 'helderoranje borst' hier," en "Ik zie een stukje dat lijkt op 'zwarte vleugels' daar."
  • Het Resultaat: De afbeelding is niet langer één grote vlek. Het is een zak met afzonderlijke, gelabelde puzzelstukjes (segmenten).

2. De "Commissie-stemming" (Het Model)

Nu kijkt de hoofddetective (het model) naar deze zak met puzzelstukjes. In plaats van ze te mengen, behandelt hij elk stukje als een getuige in een rechtszaal.

  • De Getuigen: Elk puzzelstukje (segment) zegt: "Ik ben een stukje van de vogel, en ik draag 40% bij aan het 'Vogel'-vonnis." Een ander stukje zegt: "Ik ben een stukje van de achtergrond, en ik draag 0% bij."
  • De Stemming: De detective weegt deze getuigenissen. Hij gebruikt een speciaal "attention"-mechanisme om beter te luisteren naar de stukjes die het belangrijkst lijken en de ruis te negeren.

3. Het "Gespecificeerde Bonnetje" (De Uitleg)

Dit is het magische deel. Omdat het uiteindelijke antwoord slechts de som is van de stemmen van de getuigen, kan de detective een gespecificeerd bonnetje uitprinten.

  • Het Bonnetje: Het zegt niet alleen "Vogel". Het zegt:
    • Getuige 1 (Oranje Borst): +0,42 punten voor "Vogel".
    • Getuige 2 (Zwarte Vleugels): +0,32 punten voor "Vogel".
    • Getuige 3 (Blauwe Lucht): 0 punten.
  • Het Voordeel: Je kunt precies zien waar de AI naar keek en wat hij zag. Als de AI een fout heeft gemaakt, kun je naar het bonnetje kijken en zeggen: "Ah, je hebt gefocust op het verkeerde deel van de puzzel!"

Waarom doet dit ertoe? (Het "Shortcut"-probleem)

Soms wordt AI lui. Het leert "shortcuts" (snelkoppelingen).

  • Het Scenario: Stel je een AI voor die getraind is om vogels te spotten. Het merkt op dat in de meeste trainingsfoto's vogels in of boven water zitten. Dus leert het: "Als ik water zie, is het een vogel."
  • De Fout: Als je het een vogel in een boom laat zien, kan het in de war raken omdat het naar water zoekt.
  • De Oude Manier: Globale CBM's kunnen nog steeds in de strik gelokt worden omdat ze "water" en de "vogel" mengen in één score.
  • De SEG-MIL-CBM Manier: Omdat dit model naar stukjes kijkt op zichzelf, kan het zien: "Dit stukje is een vogel in een boom (Goed!), maar dit stukje is water (Slecht/Shortcut)." Het kan ervoor kiezen om het waterstukje te negeren en zich op het vogelstukje te concenteren.

Wat hebben ze bewezen?

De auteurs hebben deze nieuwe detective getest op verschillende uitdagingen:

  1. Het is Eerlijk: Ze voerden tests uit waarbij ze de "belangrijkste" puzzelstukjes één voor één verwijderden. Het vertrouwen van het model daalde precies zoals verwacht, wat bewees dat de uitleg overeenkomt met het denkproces.
  2. Het is Slim: Het werd niet alleen beter in het uitleggen; het werd ook echt beter in het oplossen van moeilijke gevallen waarbij andere "eerlijke" modellen faalden (specifiek op datasets waar de AI meestal in de strik wordt geleid door achtergronden).
  3. Het is Snel Genoeg: Het werkt goed op standaard beeldherkennings-taken, niet alleen op de lastige.

De Kern van de Zaak

Dit paper introduceert een systeem dat de AI dwingt om zijn werk te laten zien. In plaats van een black box die een antwoord geeft, geeft het je een gehighlighte kaart van de afbeelding met een scorekaart voor elk gehighlight gebied.

  • Oude AI: "Het is een vogel." (Vertrouw me, ik ben slim.)
  • Oude "Eerlijke" AI: "Het is een vogel vanwege concepten zoals 'veren' en 'snavel'." (Maar ik kan je niet vertellen waar ik ze heb gezien.)
  • SEG-MIL-CBM: "Het is een vogel. Hier is het 'veren'-stukje aan de linkerkant (Score: 0,4), en hier is de 'snavel' aan de rechterkant (Score: 0,3). Ik heb het water op de achtergrond genegeerd."

De auteurs beweren dat dit de AI betrouwbaarder maakt, vooral wanneer het verleid zou kunnen worden tot een luie shortcut, en dat het mensen in staat stelt om de beslissing te controleren zonder een aparte, verwarrende tool nodig te hebben om het uit te leggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →