← Nieuwste papers
📊 statistics

DeGLIF for Label Noise Robust Node Classification using GNNs

Dit artikel stelt DeGLIF voor, een denoising-techniek die leave-one-out invloedfuncties op Graph Neural Networks gebruikt om robuust ruisende knopen te identificeren en te herlabelen zonder voorafgaande kennis van het ruismodel of het ruisniveau, waardoor een superieure nauwkeurigheid in nodeclassificatie wordt bereikt vergeleken met bestaande baselines.

Oorspronkelijke auteurs: Pintu Kumar, Nandyala Hemachandra

Gepubliceerd 2026-08-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pintu Kumar, Nandyala Hemachandra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie leren machines door voorbeelden te bestuderen, net zoals een student leert van een tekstboek. Maar wat gebeurt er wanneer het tekstboek vol staat met typfouten, of erger nog, wanneer de antwoorden achterin fout zijn? Dit is het probleem van ruisende labels (noisy labels). In veel realistische scenario's, van het in kaart brengen van sociale netwerken tot het diagnosticeren van ziekten aan de hand van medische scans, wordt data goedkoop en snel verzameld, vaak door groepen mensen of geautomatiseerde systemen die fouten maken. Deze fouten zijn niet slechts kleine onregelmatigheden; in systemen die vertrouwen op verbindingen tussen stukken informatie, kan één verkeerd label zich verspreiden als een gerucht, waardoor het begrip van de buren wordt gecorrumpeerd en het hele systeem kan falen. Jarenlang hebben onderzoekers geprobeerd machines te bouwen die effectief kunnen leren ondanks deze fouten, waarbij ze vaak probeerden de slechte data te negeren of hoopten dat de goede data genoeg zou zijn om de ruis te overstemmen.

Een team van onderzoekers aan het Indian Institute of Technology Bombay heeft een nieuwe manier voorgesteld om dit probleem aan te pakken, specifiek voor data die bestaat als een netwerk van verbonden punten, zoals sociale mediagebruikers of chemische moleculen. Ze noemen hun methode DeGLIF. In plaats van te proberen te raden welke labels fout zijn op basis van complexe patronen of door een specifiek type fout aan te nemen, stelt hun aanpak een eenvoudige, contra-intuïtieve vraag: "Wat zou er gebeuren met de prestaties van ons model als we simpelweg dit specifieke stuk trainingsdata zouden verwijderen?" Door het verwijderen van een enkel datapunt te simuleren en te meten hoeveel de nauwkeurigheid van het model verbetert op een kleine, vertrouwde set schone voorbeelden, kunnen ze identificeren welke labels waarschijnlijk corrupt zijn. Als het verwijderen van een knooppunt het model slimmer maakt, heeft dat knooppunt het waarschijnlijk het verkeerde lesje geleerd.

De onderzoekers ontwikkelden een wiskundige afkorting om deze vraag te beantwoorden zonder de onmogelijke taak te hoeven uitvoeren om hun model duizenden keren opnieuw te trainen, één keer voor elk individueel datapunt. Ze gebruikten een concept dat bekend staat als de leave-one-out influence function, die de impact van een datapunt schat door naar de huidige staat van het model te kijken. In de context van verbonden netwerken is dit bijzonder lastig omdat het verwijderen van één punt ook de verbindingen met de buren doorsnijdt, wat de informatiestroom voor iedereen verandert. Het team breidde bestaande methoden uit om rekening te houden met deze structurele veranderingen, waardoor ze konden berekenen hoeveel een specifiek knooppunt de voorspellingen van het model op de schone, vertrouwde data beïnvloedt. Als de aanwezigheid van een knooppunt ervoor zorgt dat het model slechter presteert op de schone data, markeert het systeem dit als ruisend.

Zodra een ruisend knooppunt is geïdentificeerd, gooit het systeem het niet simpelweg weg, wat waardevolle informatie zou verspillen. In plaats daarvan probeert het de fout te corrigeren. Voor een knooppunt met een fout label kijkt het systeem naar wat het model momenteel voorspelt voor dat knooppunt en draait het het label om naar de meest waarschijnlijke juiste klasse. De onderzoekers bewezen theoretisch dat dit proces van het corrigeren van het label wiskundig superieur is aan het volledig verwijderen van het knooppunt, omdat het de structurele waarde van het knooppunt in het netwerk behoudt terwijl de identiteit wordt hersteld. Ze testten deze aanpak op verschillende standaard datasets, waaronder grote collecties wetenschappelijke artikelen en productrecensies, waarbij ze verschillende niveaus van willekeurige fouten in de labels introduceerden. In deze tests presteerde hun methode consequent beter dan bestaande state-of-the-art technieken, waarbij de nauwkeurigheid in sommige gevallen met bijna 18 procent werd verbeterd.

De studie onderzocht ook hoe de methode zich gedraagt onder verschillende omstandigheden. Ze ontdekten dat het systeem goed werkt, zelfs wanneer de vertrouwde set schone data zeer klein is, wat minder dan twee procent van de totale dataset vertegenwoordigt. Ze observeerden dat de methode robuust is over verschillende soorten netwerkstructuren, of de verbindingen nu schaars of dicht zijn, en dat het geen voorkennis vereist over hoeveel fouten er bestaan of wat voor soort fouten het zijn. Sterker nog, de onderzoekers demonstreerden dat ze de methode herhaaldelijk konden toepassen; na de eerste ronde van opschoning was de data schoner, en een tweede ronde kon zelfs meer fouten identificeren en herstellen. Hoewel de initiële berekening aanzienlijke rekenkracht vereiste om de netwerkstructuur te analyseren, toonden de onderzoekers aan dat de methode nog steeds kon draaien op grootschalige datasets waar andere concurrerende algoritmen faalden vanwege geheugenbeperkingen.

De resultaten suggereren dat deze aanpak een veelzijdige tool biedt om rommelige data op te schonen zonder de bron van de rommel te hoeven kennen. Door zich te richten op de werkelijke impact van elk datapunt op het succes van het model, in plaats van te proberen de ruis zelf te modelleren, kan het systeem effectief het signaal van de statische ruis scheiden. De onderzoekers merkten op dat hoewel de methode computationeel intensief is, het dient als een krachtige preprocessing-stap die gecombineerd kan worden met andere leermethoden om de prestaties verder te verbeteren. In een landschap waarin hoogwaardige data duur en zeldzaam is, vertegenwoordigt dit vermogen om een ruisende, onbetrouwbare dataset om te zetten in een schone, betrouwbare dataset een belangrijke stap voorwaarts voor machine learning op verbonden data. Het werk staat als een praktische demonstratie dat het begrijpen van de invloed van individuele datapunten kan leiden tot meer veerkrachtige en nauwkeurige systemen voor kunstmatige intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →