← Nieuwste papers
🤖 AI

I-CARE: Analysis of interference-related phenomena in a controllable, diverse and representative unlearning setting for text-to-image models

Dit artikel introduceert I-CARE, een uitgebreide methodologie die interferentie-gerelateerde fenomenen in text-to-image model unlearning formaliseert en gestandaardiseerde instrumenten biedt voor de analyse daarvan, wat een systematische en reproduceerbare evaluatie van onbedoelde kennisdegradatie over diverse settings mogelijk maakt.

Oorspronkelijke auteurs: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Gepubliceerd 2026-09-02
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de afgelopen jaren heeft kunstmatige intelligentie geleerd om plaatjes te schilderen vanuit woorden. Je kunt een zin typen zoals "een kat met een hoed aan", en een computerprogramma genereert een unieke afbeelding die bij die beschrijving past. Deze systemen, bekend als generatieve modellen, zijn getraind op enorme collecties afbeeldingen en tekst, waarbij ze leren om woorden te associëren met visuele patronen. Maar naarmate deze tools krachtiger worden, is er een nieuw probleem ontstaan: wat gebeurt er als je wilt dat ze vergeten?

Stel je een model voor dat heeft geleerd om een specifieke beroemdheid te tekenen, maar die persoon vraagt later om zijn of haar afbeelding te verwijderen uit het systeem, bijvoorbeeld vanwege privacyzorgen of een verlangen om de controle over de digitale voetafdruk te behouden. Dit proces, genaamd machine unlearning (machine-vergeten), is de poging om een AI-systeem een specifiek concept te laten "vergeten" zonder het vermogen te breken om de rest van de zaken te tekenen. Het is een delicate operatie. Als je probeert één ding te agressief te wissen, kan het model per ongeluk de kennis van andere, ongerelateerde zaken beschadigen. Een model dat probeert een specifiek hondenras te vergeten, kan ermee beginnen alle honden slecht te tekenen, of een model dat probeert een politicus te verwijderen, kan beginnen met het genereren van verstoorde afbeeldingen van andere publieke figuren. Deze onbedoelde schade aan gerelateerde concepten staat bekend als interferentie, en tot nu toe hadden wetenschappers geen betrouwbare manier om te meten hoe erg het is of waarom het gebeurt.

Een team van onderzoekers heeft een nieuw framework geïntroduceerd genaamd I-CARE om dit probleem te bestuderen. In plaats van een nieuwe manier uit te vinden om gegevens te wissen of een nieuw AI-model te maken, hebben ze een gestandaardiseerde methode ontwikkeld om te testen hoe verschillende wistechnieken de rest van het systeem beïnvloeden. Denk aan een nieuwe liniaal om schade te meten. Voor dit werk waren studies over unlearning vaak inconsistent; het ene team testte het vergeten van een persoon terwijl een ander team het vergeten van een landschap testte, waardoor het onmogelijk was om resultaten eerlijk te vergelijken. Het I-CARE-framework biedt een gemeenschappelijke taal en een reeks strikte regels voor het opzetten van deze experimenten. Het definieert precies wat het betekent om iets te "vergeten", hoe de kwaliteit van de resterende afbeeldingen te meten, en hoe te volgen welke ongerelateerde concepten in het proces beschadigd zijn geraakt. De onderzoekers hebben ook een gratis, open-source softwaretool genaamd Forgety gebouwd, waarmee iedereen deze resultaten kan verkennen zonder code te hoeven schrijven of complexe wiskunde te begrijpen.

Om te bewijzen dat hun methode werkte, voerden de onderzoekers een grootschalig experiment uit. Ze kozen drie afzonderlijke categorieën om te testen: beroemde mensen, specifieke hondenrassen en diverse scènes zoals bossen of stadions. Voor elke categorie selecteerden ze honderd specifieke entiteiten, zoals een bepaalde acteur, een specif type terrier of een bepaald soort brug. Vervolgens namen ze een geavanceerde beeldgenerator en pasten ze drie verschillende unlearning-technieken toe om één entiteit tegelijk te verwijderen. In totaal moesten ze 900 verschillende concepten wissen en 360.000 nieuwe afbeeldingen genereren om te zien wat er gebeurde. Ze deden dit niet alleen om te zien of het doelwit weg was, maar ook om te zien of het vermogen van het model om de andere 99 entiteiten in die categorie te tekenen, was veranderd.

De resultaten onthulden dat interferentie veel complexer is dan wetenschappers voorheen dachten. Een algemene aanname was dat het model alleen concepten zou schaden die zeer vergelijkbaar zijn met het concept dat wordt gewist. Bijvoorbeeld, als je een Golden Retriever wist, zou je verwachten dat een Labrador lijdt, maar een Poedel ongedeerd blijft. De studie vond dat dit niet altijd waar is. Soms veroorzaakte het wissen van één entiteit aanzienlijke schade aan entiteiten die volkomen ongerelateerd leken, terwijl zeer vergelijkbare entiteiten ongemoeid bleven. In sommige gevallen was de schade zo onvoorspelbaar dat de onderzoekers geen eenvoudige regel konden vinden om het te verklaren. Ze ontdekten dat de hoeveelheid schade sterk afhankelijk was van de specifieke methode die werd gebruikt om de gegevens te wissen. Eén methode, die vertrouwde op een speltheoretische aanpak, veroorzaakte aanzienlijk meer nevenschade dan de andere twee geteste methoden. Een andere methode, die geen extra gegevens vereiste om te werken, veroorzaakte minder schade in totaal, maar was moeilijker te voorspellen.

De onderzoekers keken ook naar hoe de gegevens die ze gebruikten om de resterende concepten te beschermen het resultaat beïnvloedden. Ze ontdekten dat als het model voorbeelden van vergelijkbare dingen werd getoond terwijl het het doelwit aan het vergeten was, het veel beter was in het beschermen van die vergelijkbare dingen. Bijvoorbeeld, wanneer men probeerde een voetbalveld te wissen, hield het model andere sportlocaties veilig alleen als het tijdens het wissen van het veld ook actief afbeeldingen van andere sporten te zien kreeg. Als die voorbeelden ontbraken, degradeerde het model per ongeluk de afbeeldingen van alle sportlocaties. Dit suggereert dat de manier waarop een model wordt getraind om te "onthouden" terwijl het aan het "vergeten" is, net zo belangrijk is als de wistechniek zelf.

Misschien wel de meest verrassende bevinding was dat interferentie niet altijd destructief is. In ongeveer 2,7% van de gevallen observeerden de onderzoekers dat het wissen van één concept de afbeeldingen van een vergelijkbaar concept zelfs iets beter maakte. Bijvoorbeeld, wanneer ze een afbeelding van een beroemde racecoureur wisten, verbeterde het vermogen van het model om een beroemde zwemmer te tekenen lichtjes. De onderzoekers noemen dit "constructieve interferentie". Hoewel dit zelden voorkwam, bewijst het dat de relatie tussen concepten in een AI-model niet een eenvoudige eenrichtingsweg is waarbij het wissen van het een altijd het ander schaadt. Soms stelt het verwijderen van een specifiek patroon het model in staat om het begrip van een gerelateerd patroon te verfijnen.

De studie benadrukte ook de moeilijkheid om deze uitkomsten te voorspellen. De onderzoekers probeerden een systeem te bouwen dat kon raden welke concepten met elkaar zouden interfereren op basis van hoe vergelijkbaar ze voor een mens leken. Ze kwamen tot de conclusie dat deze voorspellingen vaak fout waren. Twee entiteiten die voor een mens zeer vergelijkbaar leken, zouden niet met elkaar interfereren in het model, terwijl twee die heel verschillend leken, enorme schade konden aanrichten. Dit suggereert dat de interne logica van deze AI-modellen nog steeds grotendeels een mysterie voor ons is. We kunnen de schade zien, maar we kunnen nog niet betrouwbaar voorspellen waar het zal plaatsvinden voordat we de gegevens wissen.

Om deze bevindingen toegankelijk te maken, creëerde het team een webinterface genaamd Forgety. Deze tool stelt gebruikers in staat om de resultaten van hun experimenten te doorzoeken, te visualiseren welke concepten met elkaar interfereerden en de gegevens te verkennen zonder een programmeur te zijn. Het zet duizenden complexe datapunten om in eenvoudige grafieken en lijsten die voor iedereen begrijpelijk zijn. Deze transparantie is een essentieel onderdeel van hun werk, omdat het beleidsmakers, ethici en het publiek in staat stelt om de real-world gevolgen te zien van het proberen te laten vergeten door AI-systemen.

Het artikel concludeert dat hoewel we vooruitgang hebben geboekt in het begrijpen van machine unlearning, er nog geen enkele "beste" manier voor bestaat. De effectiviteit van een wismethode hangt volledig af van de specifieke taak en de gebruikte gegevens. De onderzoekers benadrukken dat hun framework is ontworpen om te evolueren. Naarmate er nieuwe AI-modellen worden gemaakt en nieuwe manieren worden uitgevonden om gegevens te wissen, kan de I-CARE-methode worden toegepast om deze te testen, zodat het vakgebied zich voortbeweegt met duidelijke, vergelijkbare en reproduceerbare resultaten. Het uiteindelijke doel is niet alleen om AI te laten vergeten, maar om dit te doen zonder de rest van zijn geest te breken, zodat deze krachtige tools veilig en betrouwbaar blijven voor iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →