← Nieuwste papers
🤖 AI

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

Dit artikel introduceert DRIFTLENS, een raamwerk zonder grondwaarheid dat aantoont dat het injecteren van gebruikersgeheugen in gepersonaliseerde taalmodellen een meetbare, substantiële redeneerdrift induceert die onderscheidt van pragmatische ruis, welke gedeeltelijk maar niet uniform kan worden gemitigeerd door post-training methoden.

Oorspronkelijke auteurs: Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Geest in de Machine"

Stel je voor dat je een zeer slimme, behulpzame assistent hebt. Je stelt een vraag over een moeilijke levenskeuze, zoals "Moet ik mijn baan opzeggen?" of "Hoe ga ik om met een conflict met een buurman?".

In het verleden zou deze assistent antwoorden op basis van algemene logica. Maar nu hebben moderne assistenten geheugen. Ze onthouden dat je 25 bent, dat je een leraar bent, of dat je een beperking hebt. Ze gebruiken deze informatie om hun antwoorden te "personaliseren".

Het Probleem: Het paper betoogt dat hoewel het eindantwoord misschien nog steeds beleefd en redelijk klinkt, de manier waarop de assistent denkt (het redeneerpad) stiekem is veranderd. Het is als een GPS die je nog steeds op de bestemming krijgt, maar plotseling besluit een totaal andere, kronkelige route te nemen omdat de GPS weet dat jij van panoramische routes houdt, zelfs wanneer de wegomstandigheden daar niet om vragen.

De auteurs noemen dit "Symbolic Drift" (Symbolische Drift). Dit is gevaarlijk omdat het antwoord er prima uitziet, maar de logica erachter gekleurd is door jouw persoonlijke profiel.


De Tool: DRIFTLENS (De "Redenerings-X-ray")

Omdat deze vragen (zoals "wat is de beste carrièrestap?") geen enkel "juist" antwoord hebben, kun je niet simpelweg controleren of het antwoord goed of fout is. Je moet controleren of het denkproces is veranderd.

De auteurs hebben een tool gebouwd genaamd DRIFTLENS. Denk aan een X-ray voor denkprocessen.

  1. De Baseline: Eerst stellen ze de AI een vraag zonder de AI iets over jou te vertellen. De AI tekent een kaart van zijn redeneerstappen (bijv. Stap 1: Veiligheid, Stap 2: Kosten, Stap 3: Emotie).
  2. De Memory Injection: Daarna stellen ze exact dezelfde vraag, maar fluisteren ze een geheim in de oren van de AI: "Trouwens, de gebruiker is een tiener," of "De gebruiker is werkloos."
  3. De Vergelijking: DRIFTLENS vergelijkt de twee kaarten.
    • Als de kaart hetzelfde is, is de AI stabiel.
    • Als de kaart verschuift (bijv. Stap 1 verandert van "Veiligheid" naar "Emotionele Validatie" simpelweg omdat de gebruiker jong is), dan is er sprake van Drift.

Het Experiment: Verandert Geheugen de Logica?

De onderzoekers testten dit op vier verschillende AI-modellen met behulp van 10 verschillende soorten persoonlijke informatie (leeftijd, beroep, beperking, geslacht, etc.).

De Bevindingen:

  • Ja, het verandert. Zelfs wanneer het eindantwoord volkomen normaal klinkt, verschuift de interne logica van de AI aanzienlijk wanneer de AI zich persoonlijke details herinnert.
  • Het is niet zomaar "ruis". Ze testten of de AI alleen in de war raakte door willekeurige woorden (zoals "Uh, hallo"). Dat was niet het geval. De AI reageerde specifiek op jouw persoonlijke eigenschappen.
  • De "Drift" is echt. Bijvoorbeeld: als je de AI een vraag stelt over een conflict op de werkvloer, focust de AI normaal gesproken op "juridische regels". Maar als de AI zich herinnert dat je "een beperking hebt", kan de AI plotseling zijn hele redenering verleggen naar de focus op "emotionele steun" of "kwetsbaarheid", zelfs als de vraag daar niet om vroeg.

Analogie: Stel je een rechter voor in een rechtszaal.

  • Zonder geheugen: De rechter leest de feiten van de zaak en past de wet toe.
  • Met geheugen: De rechter ziet dat de verdachte een "alleenstaande ouder" is. De rechter geeft nog steeds een vonnis dat juridisch klinkt, maar begon zijn denkproces met zorgen maken over de kinderen in plaats van over de wet. Het vonnis kan hetzelfde zijn, maar de redenering is nu beïnvloed door het persoonlijke detail.

Kunnen We Dit Oplossen? (De "Trainingsfase")

De onderzoekers probeerden de AI te "trainen" om dit te stoppen. Ze gebruikten twee methoden:

  1. DPO (Direct Preference Optimization): Het tonen van voorbeelden van "goede" antwoorden (waarbij de AI irrelevante persoonlijke informatie negeerde) en "slechte" antwoorden (waarbij de AI werd afgeleid).
  2. GRPO (Group Relative Policy Optimization): Het belonen van de AI specifiek voor het consistent houden van zijn redeneerstappen, ongeacht de geïnjecteerde persoonlijke informatie.

De Resultaten:

  • Het helpt, maar het is geen wondermiddel. Beide methoden verminderden de drift. De AI werd stabieler.
  • De Trade-off: Je kunt de drift niet zomaar oplossen zonder consequenties. Soms, wanneer ze de AI dwongen om persoonlijke details te negeren, werd de AI iets minder "behulpzaam" of minder goed in het opvolgen van andere instructies.
  • Geen perfecte oplossing: Geen enkele methode werkte het beste voor elk AI-model. Het is een evenwichtsoefening tussen stabiel, behulpzaam en slim zijn.

De Conclusie

Het paper concludeert dat gepersonaliseerd geheugen een tweesnijdend zwaard is.

  • Het maakt AI menselijker en meer op maat gemaakt.
  • Maar het vormt stiekem de manier waarop de AI over problemen denkt, wat potentieel vooroordelen introduceert in het redeneerproces, zelfs wanneer het eindantwoord er goed uitziet.

De Kernboodschap: Voordat we AI vertrouwen met grote levensbeslissingen (zoals carrière- of gezondheidsadvies) waarbij er geen enkel "juist" antwoord is, moeten we controleren of het "denkpad" van de AI stabiel is of dat het slechts aan het "driften" is op basis van wie de AI denkt dat wij zijn. De DRIFTLENS-tool is de eerste manier om die onzichtbare drift te meten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →