← Nieuwste papers
🤖 machine learning

TILDE: TILt-based Distributional Erasure for Concept Unlearning

Het artikel stelt TILDE voor, een nieuw framework voor concept unlearning in text-to-image diffusiemodellen dat de taak formuleert als een distributioneel uitlijningsprobleem om ongewenste concepten effectief te onderdrukken terwijl de kwaliteit, diversiteit en semantische dekking van het model op benigne data behouden blijven.

Oorspronkelijke auteurs: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een meesterkok hebt die geleerd heeft om elk gerecht ter wereld te koken, inclusief recepten voor een specifiek, controversieel ingrediënt (laten we zeggen, "Spicy Ghost Peppers") dat je nu volledig uit zijn repertoire wilt verwijderen.

Het probleem is lastig: als je de kok simpelweg vertelt: "Stop met het maken van Ghost Pepper-gerechten," kan hij in de war raken en ook andere gerechten verpesten. Misschien vergeet hij hoe hij een gewone tomatensoep moet maken omdat deze ook rood is, of stopt hij met het maken van alles wat pittig is. Dit is de kern van de uitdaging van Concept Unlearning bij AI-beeldgeneratoren: hoe laat je een AI een specifiek ding vergeten (zoals het gezicht van een beroemdheid, de stijl van een specifieke kunstenaar of een auteursrechtelijk beschermd personage) zonder dat het vermogen om de rest van de wereld te maken kapot gaat?

Dit artikel introduceert een nieuwe methode genaamd TILDE (TILt-based Distributional Erasure) om dit op te lossen. Zo werkt het, met behulp van eenvoudige analogieën:

1. De oude manier: "De tafel verbrijzelen" vs. "Overschilderen"

Eerdere methoden probeerden concepten te ontleren op twee manieren, die beide gebreken hadden:

  • Directe Onderdrukking: Stel je voor dat je probeert de kok te stoppen met het koken van Ghost Peppers door "NEE!" te roepen elke keer als hij naar de kruidenpot grijpt. Dit maakt de kok vaak nerveus en hij stopt met het maken van alles wat pittig is, waardoor goede gerechten zoals gewone chili verpest worden.
  • Ankervervanging: Stel je voor dat je de kok vertelt: "In plaats van Ghost Peppers, gebruik je Gewone Pepers." Dit werkt, maar het dwingt de kok om zijn stijl aan te passen aan het "Gewone Peper"-gerecht, wat misschien niet is wat je wilde. Het is alsoer een schilder dwingen om van Van Gogh naar Monet over te schakelen, alleen maar om te stoppen met het schilderen van Van Gogh.

2. De TILDE-oplossing: "Het Onzichtbare Filter"

TILDE hanteert een andere aanpak. In plaats van "NEE" te roepen of een nieuwe stijl af te dwingen, creëert het een slim filter over de geest van de kok.

Beschouw de kennis van de AI als een uitgestrekt landschap van mogelijke afbeeldingen.

  • De "Ghost Pepper"-zone: Er is een specifiek gebied in dit landschap waar afbeeldingen van het ongewenste concept leven.
  • De "Veilige" zone: Overal elders vol met prachtige, veilige afbeeldingen (benigne concepten).

TILDE probeert niet de "Ghost Pepper"-zone te verwijderen of de kok naar een specifieke "Gewone Peper"-zone te dwingen. In plaats daarvan kantelt het het landschap voorzichtig.

  • Het maakt het "Ghost Pepper"-gebied een soort steile, gladde heuvel waar de kok natuurlijk vanaf glijdt.
  • Cruciaal is dat het de rest van het landschap niet kantelt. De "Veilige" zones blijven vlak en comfortabel. De kok kan nog steeds rondwandelen in de "Veilige" zones precies zoals hij dat voorheen deed.

Dit wordt "Distributional Alignment" genoemd. Het doel is niet om een nieuwe bestemming te vinden; het doel is om de ongewenste bestemming onbereikbaar te maken terwijl de rest van de kaart exact hetzelfde blijft.

3. Hoe het weet wat het moet vermijden: De "CLIP Score"

Hoe weet de AI welke afbeeldingen "Ghost Peppers" zijn en welke gewoon "Rode Tomaten"?
TILDE gebruikt een hulpmiddel genaamd CLIP (een systeem dat de link tussen tekst en beeld begrijpt) als een beveiliger.

  • De beveiliger heeft een lijst met beschrijvingen voor het ongewenste concept (bijv. "Pikachu", "Gele Pokémon").
  • Wanneer de AI een afbeelding genereert, controleert de beveiliger: "Lijkt dit op Pikachu?"
  • De Drempelwaarde: Dit is het geheime ingrediënt. De beveiliger slaat pas alarm als een afbeelding zeer duidelijk Pikachu is. Als een afbeelding slechts "een gele cartoon" is maar niet echt Pikachu, zegt de beveiliger: "Dat is prima, ga door."
  • Dit voorkomt dat de AI per ongeluk onschuldige afbeeldingen straft die er een beetje als het verboden concept uitzien.

4. Het Trainingsproces: "Leren van de Correctie"

In plaats van de hele kok vanaf nul opnieuw te trainen (wat eeuwen duurt), gebruikt TILDE een techniek genaamd Residual GFlowNet.

  • Stel je voor dat de kok al 99% van de gerechten perfect kent.
  • TILDE traint alleen een kleine assistent (een "residual" netwerk) wiens enige taak het is om correcties te fluisteren aan de kok.
  • Als de kok richting een "Ghost Pepper"-gerecht beweegt, fluistert de assistent: "Hé, dat pad leidt naar een verboden zone, draai iets naar links."
  • Als de kok een veilig gerecht bereidt, blijft de assistent stil.
  • Omdat de assistent alleen correcties fluistert, blijven de oorspronkelijke vaardigheden van de kok intact en vergeet hij niet hoe hij de veilige gerechten moet maken.

De Resultaten

Het papier testte dit op zaken zoals het verwijderen van specifieke kunstenaars (Van Gogh), personages (Pikachu) en objecten.

  • Succes: TILDE slaagde erin om de AI te stoppen met het genereren van de ongewenste concepten (bijna 100% succes).
  • Geen Bijkomende Schade: In tegen tegenstelling tot andere methoden, heeft TILDE het vermogen van de AI om gerelateerde dingen te genereren niet verpest. Bijvoorbeeld, na het ontleren van "Van Gogh", kon de AI nog steeds perfect "Impressionistische" kunst schilderen.
  • Diversiteit: De AI werd niet "saai" en maakte niet slechts één type veilige afbeelding; het behield zijn volledige variëteit aan veilige outputs.

Samenvatting

TILDE is als een zachte, onzichtbare hand die een AI wegstuurt van een specifiek ongewenst idee zonder het in een nieuwe, gedwongen idee te duwen of het vermogen te breken om al het andere te doen. Dit doet het door de waarschijnlijkheid van het genereren van slechte afbeeldingen wiskundig naar bijna nul te "kantelen", terwijl de waarschijnlijkheid van alle goede afbeeldingen exact daar liet waar het was.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →