← Nieuwste papers
🤖 machine learning

XMix: Combating Extremely Noisy Labels via Local Smoothness in Self-Supervised Feature Space

MixX is een nieuw framework dat lokale gladheid in zelfgesuperviseerde feature-ruimtes benut om ruispercentages te schatten, gebalanceerde schone monsters te selecteren en betrouwbare pseudo-labels te genereren, waardoor het bestaande methoden aanzienlijk overtreft bij het omgaan met extreem ruisige labels zonder voorafgaande kennis van de ruis te vereisen.

Oorspronkelijke auteurs: Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

Gepubliceerd 2026-07-28
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om dieren te herkennen. Je laat het de robot duizenden afbeeldingen zien, maar hier is de crux: de labels op de plaatjes zijn geschreven door een vermoeid, afgeleid of zelfs ondeugend mens. Soms wordt een foto van een kat gelabeld als "hond", en een foto van een auto als "vliegtuig". Dit is de rommelige realiteit van "Leren met Ruisende Labels". In de wereld van kunstmatige intelligentie hebben modellen meestal perfecte data nodig om te leren, maar in de echte wereld is perfecte data zeldzaam en duur. Wetenschappers proberen robots te bouwen die de slechte labels kunnen negeren en kunnen leren van de goede, maar wanneer de ruis echt hoog wordt—zoals wanneer 90% van de labels fout is—geven de meeste robots het op of raken ze in de war.

Het artikel dat je nu gaat lezen, pakt precies dit probleem aan. Het introduceert een nieuwe methode genaamd XMix. Denk aan XMix als een detective die niet alleen de geschreven labels op de bestanden vertrouwt. In plaats daarvan kijkt de detective naar de afbeeldingen zelf om te zien welke er "bij elkaar passen". Als een foto van een kat erg lijkt op andere foto's van katten in het geheugen van de robot, gaat de detective ervan uit dat ze allemaal katten zijn, zelfs als de labels iets anders zeggen. Deze aanpak maakt gebruik van een concept genaamd "lokale gladheid" (local smoothness), wat een chique manier is om te zeggen: "Dingen die op elkaar lijken, behoren meestal tot dezelfde groep." Door deze logica te gebruiken, probeert XMix de rommel op te ruimen en de robot veel beter te onderwijzen dan eerdere methoden, vooral wanneer de data een totale chaos is.

Het Probleem: Een Klaslokaal Volna met Streken

Stel je een klaslokaal voor waar een leraar probeert leerlingen te leren verschillende soorten fruit te herkennen. De leraar heeft een stapel flashcards, maar een groepje stoute kinderen heeft de labels omgewisseld. Sommige appels zijn gelabeld als "bananen", en sommige sinaasappels zijn gelabeld als "druiven".

In het verleden hadden slimme computerprogramma's (genaamd deep learning modellen) een trucje in hun mouw genaamd het "memorisatie-effect". Ze bestudeerden de kaarten en realiseerden zich: "Hé, ik ben heel goed in het raden van het label voor deze specifieke kaart, maar ik ben verschrikkelijk in het raden van dat label." Ze gingen ervan uit dat de kaarten die ze goed konden raden de echte waren (schone data) en de kaarten waarmee ze worstelden de leugens van de stoute kinderen (ruisende data).

Maar hier is het probleem: wanneer de stoute kinderen volledig doordraaien en 90% van de labels omwisselen, raakt de computer in de war. Hij kan het verschil niet meer zien tussen een echte appel en een banaan die als appel is gelabeld. Ook eindigt de computer er vaak mee dat hij slechts één type fruit bestudeert en de rest negeert, waardoor hij slecht wordt in het herkennen van de volledige variëteit. Hij heeft een nieuwe strategie nodig die er niet van afhankelijk is om precies te weten hoeveel stoute kinderen er in de kamer zijn.

De Oplossing: XMix en de "Lijkt-op"-regel

Hier komt XMix in beeld, de nieuwe detective. In plaats van alleen naar de geschreven labels te kijken, gebruikt XMix een speciale bril (een self-supervised feature encoder) om naar de visuele details van het fruit te kijken. Het weet dat een rode, ronde vrucht met een steeltje veel lijkt op andere rode, ronde vruchten met steeltjes.

Zo lost XMix de drie grote problemen op:

1. De ruisgraad raden zonder spiekbriefje
Normaal gesproken hebben deze computerprogramma's precies moeten weten hoeveel labels fout zijn (bijv. "50% is fout") om hun regels in te stellen. Als ze het fout raden, falen ze. XMix heeft dit spiekbriefje niet nodig. Het kijelt naar een vrucht en haar dichtstbijzijnde "lijkt-op" buren in de beeldenwereld. Als de buren allemaal verschillende labels hebben, berekent XMix: "Wauw, de ruis moet hier echt heel hoog zijn." Het gebruikt een wiskundige truc genaamd "maximum likelihood" om het ruisniveau automatisch in te schatten. Het is als een detective die naar een plaats delict kijkt en zegt: "Op basis van hoeveel kapotte ramen er zijn, zou ik gokken dat dit een rel was," zonder dat er een politierapport nodig is.

2. Meer Goede Studenten Vinden (Gebalanceerde & Uitgebreide Selectie)
Wanneer de ruis extreem is, vinden de oude methoden slechts een paar "schone" monsters (goede studenten) om te bestuderen. XMix zegt: "Wacht, als we één goede appel hebben gevonden, en die lijkt precies op deze vijf andere appels in de buurt, laten we die vijf ook vertrouwen!" Het breidt de groep vertrouwde monsters uit door ook de naburige exemplaren toe te voegen.
Cruciaal is dat het ook het probleem van "klasse-imbalans" oplost. Als de stoute kinderen alle "banaan"-labels hebben verstopt, zou de computer misschien stoppen met het bestuderen van bananen. XMix merkt dit op en zegt: "We hebben meer bananen nodig!" Het zoekt nog verder naar look-alikes van bananen om ervoor te zorgen dat elk fruit een eerlijke kans krijgt om bestudeerd te worden. Dit zorgt ervoor dat de robot een gebalanceerd dieet aan kennis leert, en niet alleen zijn favoriete vrucht.

3. Beter Raden voor het Onbekende
Ten slotte, voor de kaarten waar hij nog steeds niet over zeker is (de ruisende kaarten), gokt XMix niet zomaan een willekeurig antwoord. Het vraagt aan de buren: "Wat denk jij dat dit is?" Het neemt de meningen van de meest vertrouwde buren (de schone exemplaren) en middelt deze om een "pseudo-label" (een best-guess label) te creëren. Dit is als het vragen aan een groep experts om over een mysterieus object te stemmen. Omdat de experts worden gekozen op basis van hoe erg ze op het object lijken, is hun stem veel betrouwbaarder dan een willekeurige gok.

Wat Ze Vonden: De Kansen Verslaan

De onderzoekers hebben XMix getest op beroemde beelddatasets zoals CIFAR-10 en CIFAR-100, die foto's bevatten van auto's, vliegtuigen, dieren en meer. Ze hebben de labels opzettelijk verpest om extreme scenario's te creëren:

  • 90% Symmetrische Ruis: Stel je voor dat 90 van de 100 labels volledig willekeurig zijn.
  • 98% Ruis: Bijna alles is een leugen.

In deze brute omstandigheden begonnen eerdere methoden (zoals DivideMix en ProMix) te wankelen. Bijvoorbeeld, op CIFAR-10 met 90% ruis behaalde de oude beste methode (DivideMix) slechts ongeveer 76% nauwkeurigheid. XMix verhoogde dit echter naar 91,2%. Op CIFAR-100 met 95% ruis behaalde de oude methode 19,1%, terwijl XMix 31,4% bereikte.

Het artikel laat zien dat XMix niet zomaar een beetje beter werkt; het blinkt uit wanneer de situatie het meest wanhopig is. Het identificeerde succesvol veel meer "echte schone" monsters dan de oude methoden, soms zelfs het aantal goede voorbeelden waar de robot van kon leren, verdubbelde of verdrievoudigde.

Het Oordeel

XMix bewijst dat je niet de exacte mate van chaos in je data hoeft te kennen om het op te schonen. Door te vertrouwen op de visuele gelijkenissen tussen afbeeldingen — door gebruik te maken van de "lokale gladheid" van de feature space — kan het automatisch de strategie aanpassen, meer goede data vinden en de robot leren om de ruis te negeren.

De auteurs suggereren dat deze methode een belangrijke stap voorwaarts is, vooral voor scenario's in de echte wereld waarbij data rommelig is en we geen handmatige instructie hebben over hoe erg het is. Hoewel het geen toverstaf is die alles perfect oplost (het maakt nog steeds enkele fouten, vooral wanneer de ruis laag is en de uitbreiding niet nodig is), presteert het consequent beter dan de huidige state-of-the-art methoden in de meest uitdagende, hoog-ruis omgevingen. Het verandert een chaotisch klaslokaal vol stoute kinderen in een plek waar nog steeds geleerd kan worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →