← Nieuwste papers
💬 NLP

MoRFI: Monotonic Sparse Autoencoder Feature Identification

Dit artikel introduceert MoRFI, een methode die gebruikmaakt van sparse autoencoders om latente richtingen in grote taalmodellen te identificeren die monotoon correleren met hallucinaties tijdens fine-tuning op nieuwe kennis, en toont aan dat deze specifieke kenmerken kunnen worden ingegrepen om het vermogen van het model om opgeslagen kennis op te halen, te herstellen.

Oorspronkelijke auteurs: Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

Gepubliceerd 2026-04-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (LLM) voor als een briljante student die jarenlang een enorme bibliotheek vol boeken heeft gelezen (pre-training). Deze student heeft een enorme hoeveelheid feiten uit het hoofd geleerd. Echter, wanneer we hen later vragen om een nieuwe, specifieke set feiten te leren (fine-tuning), gebeurt er iets vreemds: als de nieuwe feiten de student volledig onbekend zijn, beginnen ze te "hallucineren". Ze beginnen met overtuiging antwoorden te verzinnen, zelfs voor de oude feiten die ze voorheen perfect kenden.

Dit artikel, MoRFI, onderzoekt waarom dit binnen het brein van de student gebeurt en hoe het op te lossen is zonder hen alles opnieuw te leren.

Het Probleem: De "Nieuwe Kennis"-Glitch

Stel je het brein van de student voor als een gigantische, complexe controlekamer vol met duizenden lichtschakelaars (deze worden latente kenmerken genoemd). Wanneer de student nieuwe dingen leert, schakelen ze sommige schakelaars om. De onderzoekers ontdekten dat wanneer ze de student dwingen om veel nieuwe feiten te leren die ze eerder niet kenden, een specifieke set schakelaars vast komt te zitten in de "AAN"-stand.

Deze vastzittende schakelaars werken als een luid geluid of een afleiding. Ze verdrinken de stille, stabiele signalen die de student nodig heeft om hun oude, vertrouwde kennis op te halen. Hoe meer nieuwe, onbekende feiten ze proberen te proppen, en hoe langer ze studeren, hoe luider dit geluid wordt, en hoe slechter ze worden in het beantwoorden van vragen over wat ze al wisten.

De Oplossing: MoRFI (De Detective)

De onderzoekers bouwden een tool genaamd MoRFI (Monotonic Relationship Feature Identification). Stel je MoRFI voor als een superintelligente detective met een speciaal paar bril.

  1. Het Onderzoek: De detective observeert de controlekamer van de student terwijl ze leren. Ze zoeken naar schakelaars die zich op een zeer specifieke manier gedragen: naarmate de student meer en meer "onbekende" feiten krijgt, worden deze specifieke schakelaars steeds helderder (of steeds donkerder) in een stabiele, voorspelbare lijn.
  2. Het Filter: De meeste schakelaars flitsen gewoon willekeurig. MoRFI negeert die. Het geeft alleen om schakelaars die monotoon veranderen—wat betekent dat ze in één consistente richting veranderen naarmate de nieuwe kennis toeneemt.
  3. De Ontdekking: Door deze specifieke schakelaars te volgen over verschillende modellen heen (zoals Llama, Gemma en Mistral), ontdekte de detective een kleine, verspreide groep die direct verantwoordelijk is voor het "hallucinatieruis".

De Oplossing: De Schakelaars Terugzetten

Zodra de detective deze "probleemschakelaars" heeft geïdentificeerd, probeerden de onderzoekers een eenvoudig experiment: Sturen.

In plaats van de student opnieuw te trainen, grepen ze fysiek in de controlekamer en zetten ze die specifieke schakelaars terug naar hun oorspronkelijke staat (of schakelden ze ze in de tegenovergestelde richting).

  • Het Resultaat: Het werkte als magie. Door slechts deze paar schakelaars aan te passen, herinnerde de student plotseling weer hun oude feiten.
  • De Analogie: Het is als een radio die te veel statische storing heeft opgepikt van een nieuw station. In plaats van de radio te herbouwen, draai je de knop gewoon een beetje om de statische frequentie te neutraliseren. De muziek (de oude kennis) wordt weer helder.

Belangrijkste Bevindingen in Gewoon Nederlands

  • Het is geen Verwijdering, maar Blokkering: De studie vond dat de student de oude feiten niet echt vergeten was. De feiten waren er nog steeds, maar het "ruis" van het nieuwe leren blokkeerde het pad om ze op te halen. Het terugzetten van de schakelaars ruimde het pad op.
  • Uitzetten is Beter dan Aanzetten: De onderzoekers ontdekten dat het voor sommige schakelaars effectiever was om ze uit te zetten (te onderdrukken) dan om ze harder te zetten. Dit suggereert dat het nieuwe leren bepaalde delen van het brein te sterk activeerde, en dat het kalmeren daarvan de sleutel was.
  • Het Werkt Overal: Ze testten dit op drie verschillende soorten "studenten" (verschillende AI-modellen), en dezelfde kleine groep schakelaars veroorzaakte het probleem in allemaal. Dit suggereert een universeel mechanisme voor hoe deze modellen in de war raken.
  • De "Samengestelde" versus "Enkele" Schakelaar: Als je probeert het probleem op te lossen door alle veranderingen tegelijk aan te passen (een "samengestelde" richting), helpt dat een beetje. Maar als je de enkele belangrijkste schakelaar vindt en alleen die één repareert, is de verbetering enorm. Dit betekent dat het probleem zeer specifiek en lokaal is, en niet een algemene mist over het hele brein.

Samenvatting

Het artikel betoogt dat wanneer AI-modellen nieuwe, onbekende feiten leren, ze hun oude kennis niet verliezen; ze worden gewoon "afgeleid" door een paar specifieke interne signalen. De auteurs creëerden een methode om deze afleidende signalen te vinden en toonden aan dat het simpelweg uitschakelen (of aanpassen) ervan de AI direct in staat stelt om weer correct vragen te beantwoorden, waardoor de hallucinatie veroorzaakt door de nieuwe trainingsdata effectief wordt genezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →