← Nieuwste papers
💬 NLP

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

Dit artikel toont aan dat daaropvolgende fijnafstemming over het algemeen een substantiële afname van kenniswijzigingen veroorzaakt, wat onthult dat het enkel fijnafstemmen van de gewijzigde lagen een effectieve methode is om dergelijke wijzigingen te verwijderen terwijl de prestaties in downstream-taken behouden blijven, waardoor de kritieke noodzaak wordt benadrukt om kenniswijziging te evalueren binnen de bredere context van modeladaptatie-pipelines.

Oorspronkelijke auteurs: Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

Gepubliceerd 2026-06-30
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Kun je over een correctie heen schilderen?

Stel je voor dat je een gigantische, ongelooflijk slimme encyclopedie hebt (een Large Language Model, of LLM) die is geschreven door een team van experts. Soms bevat de encyclopedie fouten. Misschien staat er dat de hoofdstad van Frankrijk Berlijn is.

Knowledge Editing (KE) is als het sturen van een specialist om die specifieke fout te herstellen. De specialist gaat naar binnen, vindt de pagina en verandert "Berlijn" in "Parijs". Dit gebeurt zonder het hele boek te herschrijven. Het is snel, goedkoop en precies.

Fine-Tuning (FT) is als het nemen van die encyclopedie en deze te trainen op een nieuw onderwerp, bijvoorbeeld "Moderne Kunst". Je voert het duizenden nieuwe artikelen om het te helpen leren over schilderkunst en beeldhouwkunst. Dit is de standaardmanier om deze modellen nuttig te maken voor specifieke taken.

Het Probleem: De onderzoekers stelden een eenvoudige vraag: Als je een fout herstelt (KE) en daarna het boek traint op nieuwe onderwerpen (FT), blijft de correctie dan bestaan? Of wist de nieuwe training de correctie per ongeluk weg, waardoor "Berlijn" weer terugkomt?

De Belangrijkste Ontdekking: De Correctie is Fragiel

De belangrijkste bevinding van het papier is dat fine-tuning de edits vaak wist.

Denk aan de kennis van het model als een delicate sculptuur gemaakt van klei.

  • Knowledge Editing is als het voorzichtig toevoegen van een klein, specifiek detail aan de sculptuur (bijvoorbeeld het schilderen van een bloemetje op de klei).
  • Fine-Tuning is als het krachtig schudden van de hele sculptuur om het voor een nieuw doel te hervormen.

De studie toonde aan dat wanneer je de sculptuur schudt (fine-tuning), het kleine geschilderde bloemetje (de edit) vaak eraf valt of uitveegt. In veel gevallen keert het model terug naar zijn oorspronkelijke, onjuiste antwoord, of erger nog, het begint een compleet nieuw, fout antwoord te geven dat er eerst niet was.

Het Experiment: Een Massale Stress-test

De onderzoekers gokten niet zomaar; ze voerden een massaal experiment uit.

  • Ze namen 5 verschillende modellen (de "encyclopedieën").
  • Ze gebruikten 3 verschillende editing-tools (de "schilders").
  • Ze pasten 254 verschillende combinaties van editing en training toe.

De Resultaten:

  • Meestal stierven de edits. Na fine-tuning werd een aanzienlijk deel van de succesvolle correcties een mislukking.
  • De "Null Space" Kwetsbaarheid: Eén specifieke editing-methode (AlphaEdit) was het meest fragiel. Deze probeert de edit te verbergen in een "schaduwzone" van het brein van het model die normaal gesproken geen invloed heeft op iets. Maar fine-tuning is zo krachtig dat het die schaduwzone vult met nieuwe informatie, waardoor de edit volledig wordt uitgewist.
  • Modelgrootte Doet Er Toe: Grotere modellen (zoals GPT-J) waren iets robuuster en hielden hun edits beter vast dan kleinere modellen, maar ook zij leden onder het probleem.

Het "Flip" Fenomeen

De onderzoekers merkten drie vreemde dingen op die gebeurden na fine-tuning:

  1. Stabiele Edits: De correctie blijft bestaan. (Zeldzaam).
  2. Gewiste Edits: De correctie verdwijnt en het model keert terug naar het oorspronkelijke foute antwoord. (Veelvoorkomend).
  3. Onmogelijke Edits: Het model raakt in de war en geeft een derde fout antwoord dat noch het oorspronkelijke, noch de beoogde fix was. (Bijvoorbeeld: als je probeerde "Parijs" te veranderen in "Londen", kan het model na de training "Berlijn" gaan zeggen).

De Verrassende Wending: Hoe je Edits Met Opzet Verwijdert

Het papier keek ook naar hoe je slechte edits (zoals kwaadwillende edits die door hackers zijn geplaatst) kunt verwijderen of goede kunt behouden. Ze testten een slimme strategie: Train niet het hele model; train alleen specifieke onderdelen.

  • Hypothese 1: Als je alleen de lagen traint waar de edit is gemaakt, zou je de edit moeten wissen.
    • Resultaat: Waar. Dit was de meest effectieve manier om een edit te verwijderen. Het is als het afschuren van precies de plek waar de slechte verf is aangebracht.
  • Hypothese 2: Als je alleen de lagen traint die niet betrokken zijn bij de edit, zou je de edit moeten beschermen.
    • Resultaat: Onwaar. Verrassend genoeg vernietigde het trainen van de "veilige" lagen de edits zelfs meer dan het trainen van het hele model. Het is alsof je de basis van de sculptuur zo hard schudt dat het detail bovenop eraf valt, zelfs als je het bovenste deel niet direct hebt aangeraakt.

De Les: Als je een slechte edit wilt verwijderen, is de meest efficiënte manier om alleen de specifieke lagen te fine-tunen waar die edit zich bevindt. Het is een precieze chirurgische aanval die de slechte data verwijdert terwijl de rest van de prestaties van het model grotendeels intact blijft.

Waarom Gebeurt Dit? (De Breinscant)

De onderzoekers keken in het "brein" van het model (de activatieruimte) om te zien wat er gebeurde.

  • Editing is als een kleine, lokale rimpeling in een vijver. Het verandert het water op één specifieke plek.
  • Fine-Tuning is als een enorme golf die door de hele vijver slaat.

De studie vond dat de "golf" van fine-tuning veel sterker is en in een andere richting beweegt dan de "rimpeling" van de edit. Wanneer de golf de rimpeling raakt, overschrijft deze de rimpeling volledig. De interne representatie van het model verschuift zo drastisch dat de kleine correctie niet kan overleven.

Samenvatting voor de Gewone Lezer

  1. Edits zijn tijdelijk: Als je een feit in een AI corrigeert en daarna de AI traint op nieuwe data, zal je correctie waarschijnlijk verdwijnen.
  2. Het is niet jouw schuld: De architectuur van het model maakt het erg moeilijk om een kleine verandering te behouden terwijl het veel nieuwe dingen leert.
  3. Je kunt edits gemakkelijk verwijderen: Als je een slechte edit wilt verwijderen, hoef je niet de hele AI opnieuw te trainen. Je kunt gewoon de specifieke onderdelen aanpassen waar de slechte edit leeft, en het zal verdwijnen.
  4. Waarschuwing voor de veiligheid: Als kwaadwillenden leugens in een AI planten (knowledge editing), en bedrijven trainen die AI vervolgens voor nieuwe taken, kunnen die leugens overleven en zich verspreiden, of kan de AI in de war raken en nieuwe leugens gaan verzinnen (hallucineren).

Het papier concludeert dat we moeten stoppen met het behandelen van "feiten corrigeren" en "trainen voor nieuwe taken" als aparte stappen. We moeten AI-systemen bouwen waarbij deze twee processen naast elkaar kunnen bestaan zonder dat het een ander proces vernietigt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →