← Nieuwste papers
💻 computer science

Output Vector Editing for Memorization Mitigation in Large Language Models

Dit artikel stelt "output vector editing" voor, een techniek van beperkte optimalisatie die de outputvectoren van specifieke MLP-neuronen minimaal wijzigt om gememoriseerde sequenties in grote taalmodellen te onderdrukken, waarbij significant hogere mitigatiesnelheden worden bereikt dan traditionele zero-ablatie methoden, terwijl aandachtmechanismen worden geïdentificeerd als een noodzakelijke aanvullende fallback voor een subset van onbereikbare gevallen.

Oorspronkelijke auteurs: Ahmad Dawar Hakimi, Kaiwei Lei, Isabelle Augenstein, Hinrich Schütze

Gepubliceerd 2026-06-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ahmad Dawar Hakimi, Kaiwei Lei, Isabelle Augenstein, Hinrich Schütze

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: Het "Slechte Geheugen" van het Model

Stel je een Large Language Model (LLM) voor als een student die het hele internet heeft gelezen. Soms leert deze student niet alleen concepten, maar memoriseert hij specifieke zinnen woord voor woord uit zijn tekstboeken (de trainingsdata).

Dit is gevaarlijk. Als je de student vraagt om een zin af te maken, kan hij per ongeluk een privé-e-mail, een auteursrechtelijk beschermd boek of een geheim wachtwoord reciteren dat hij per ongeluk heeft "geleerd". Dit wordt memorisatie genoemd.

De Oude Oplossing: De "Brute Force"-aanpak

Voorheen probeerden onderzoekers dit op te lossen door de specifieke "hersencellen" (neuronen) in het model te vinden die verantwoordelijk zijn voor de gememoriseerde zin en deze simpelweg uit te schakelen.

  • De Analogie: Stel je voor dat het brein van het model een drukke keuken is. Als een specifieke chef (neuron) steeds een privé telefoonnummer naar buiten schreeuwt, was de oude methode om de handen van die chef achter zijn rug te binden, zodat hij helemaal niet meer kan koken.
  • De Fout: Die chef kan ook heel goed zijn in andere dingen (zoals soep maken of groenten snijden). Het binden van zijn handen stopt het telefoonnummer, maar verpest ook de soep. Het model verliest nuttige kennis om slechts één slechte herinnering te stoppen.

De Nieuwe Oplossing: "Output Vector Editing"

De auteurs stellen een slimmere manier voor: Output Vector Editing. In plaats van de handen van de chef te binden, geven ze de chef een nieuw receptenkaartje dat verandert wat hij naar buiten schreeuwt, zonder hem te stoppen met werken.

  • Hoe het werkt:
    1. Vind de Dader: Ze lokaliseren de specifieke neuronen die op het punt staan de gememoriseerde tekst uit te spugen.
    2. De "Afleidings"-truc: In plaats van het neuron te verzwijgen, passen ze de "output vector" van het neuron aan (de specifieke richting waarin het wijst in het brein van het model). Ze duwen het een klein beetje zodat het, in plaats van naar het gememoriseerde woord te wijzen, naar een afleider wijst.
    3. Het Resultaat: Het neuron vuurt nog steeds (het is nog steeds actief), maar het suggereert nu een ander, onschadelijk woord. De gememoriseerde zin is doorbroken, maar het neuron is nog steeds vrij om zijn andere taken te doen (zoals soep maken).

De Vier "Modi" van Bewerken

De onderzoekers testten vier verschillende manieren om het "afleidingswoord" te kiezen, wat een spectrum creëert van mild naar agressief:

  1. Redact (De "Censor"): Het model wordt gestuurd om een reeks sterretjes (****) uit te voeren. Het is alsof je een zwarte balk over de gevoelige tekst plaatst. Dit is zeer veilig voor de algemene intelligentie van het model, maar stopt slechts ongeveer 32% van de gememoriseerde zinnen.
  2. Next-Best (De "Slimme Wissel"): Het model wordt gestuurd om het op één na meest waarschijnlijke woord te zeggen in plaats van het gememoriseerde woord. Dit voelt natuurlijk en vloeiend aan. Het stopt ongeveer 81,5% van de gememoriseerde zinnen en verstoort zelden het vermogen van het model om andere vragen te beantwoorden.
  3. EOS (Het "Stopbord"): Het model wordt gestuurd om de zin onmiddellijk te beëindigen (End of Sequence). Dit is de meest agressieve methode, die 87,9% van de gememoriseerde zinnen stopt, maar het zorgt er soms voor dat het model ontspoort bij andere taken (zoals een auto die te hard remt en gaat slippen).
  4. Suppress (De "Demper"): Het model wordt gestuwd om de kans op het verschijnen van het slechte woord actief te verlagen, zonder een specifere vervanging voor te stellen.

Belangrijkste Bevindingen

  • Het gaat over de "Richting", niet het "Volume": Het papier bewijst dat het probleem niet is dat de neuronen "te hard geluiden" (activatie), maar dat ze in de "verkeerde richting" wijzen (output vector). De richting veranderen werkt veel beter dan het volume omlaag draaien.
  • Het "Sweet Spot": De "Next-Best" modus is de winnaar. Het stopt de meeste slechte herinneringen (81,5%) zonder "catastrofale fouten" te veroorzaken (waarbij het model volledig vergeet hoe het Engels spreekt).
  • Grootte Matters: Grotere modellen (zoals de 7-miljard parameters modellen) zijn gemakkelijker te repareren dan kleinere modellen. Hoe groter het model, hoe meer "ruimte" het heeft om deze kleine aanpassingen op te vangen zonder kapot te gaan.
  • De Limiet: Ongeveer 14% van de gememoriseerde sequenties is te complex voor deze methode. Ze vertrouwen op een ander deel van het brein (het "attention"-mechanisme) in plaats van de neuronen die de auteurs bewerken. Voor deze gevallen suggereren de auteurs dat een hybride aanpak nodig kan zijn.

De Kernboodschap

Dit artikel introduceert een chirurgisch instrument dat de inhoud van het geheugen van een model bewerkt in plaats van de hardware die het bevat te verwijderen. Het stelt ons in staat om privéteksten of auteursrechtelijk beschermde tekst uit AI-modellen te verwijderen zonder per ongeluk hun algemene intelligentie te lobotomiseren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →