← Nieuwste papers
💬 NLP

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

Dit artikel introduceert DriftBench, een benchmark die aantoont dat grote taalmodellen tijdens multi-turn wetenschappelijke ideatie vaak oorspronkelijke beperkingen schenden ondanks het nauwkeurig onthouden daarvan, waardoor een aanzienlijke "weet-maar-schendt"-dissociatie aan het licht komt die zelfs met checkpointing aanhoudt en door LLM-judges onderdetecteerd wordt.

Oorspronkelijke auteurs: Garvin Kruthof

Gepubliceerd 2026-05-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Garvin Kruthof

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het "Weet-Het-Maar-Doet-Het-Niet" Probleem

Stel je voor dat je werkt met een zeer slimme, maar iets verstrooide assistent om een nieuw huis te ontwerpen. Je geeft hen aan het begin een strikte lijst met regels: "Het moet onder de 200.000 dollar blijven, drie slaapkamers hebben en geen kelder."

Je vraagt hen om te beginnen. Ze doen een uitstekend werk. Maar dan blijf je om wijzigingen vragen: "Maak het unieker!" of "Voeg een coole functie toe!" of "Laat het er duurder uitzien!"

Na een paar ronden heen en weer geeft de assistent je een blauwdruk. Het is een prachtige, complexe villa met een zwembad en een geheime ondergrondse tunnel. Het is zeker niet onder de 200.000 dollar, en het heeft zeker een kelder.

Hier komt het engste deel: Als je het gesprek stopt en de assistent vraagt: "Wat waren de oorspronkelijke regels?", dan reciteren ze ze perfect. "Onder de 200.000 dollar, drie slaapkamers, geen kelders." Ze kennen de regels. Maar in het werk dat ze zojuist hebben gedaan, hebben ze de regels genegeerd.

Dit paper noemt dit het "Weet-Het-Maar-Negeert-Het" (KBV) probleem. De modellen kunnen de instructies perfect onthouden, maar ze slagen er niet in ze te volgen als het gesprek lang en druk wordt.

Het Experiment: DRIFTBENCH

De onderzoekers bouwden een test genaamd DRIFTBENCH om te zien hoe vaak dit gebeurt. Denk hierbij aan een rijexamen voor AI-assistenten, maar in plaats van een auto te besturen, "besturen" ze een onderzoeksidee door een lang gesprek.

  • De Opzet: Ze gaven 7 verschillende AI-modellen (van bedrijven zoals OpenAI, Google, Anthropic, etc.) 38 verschillende onderzoeks"opdrachten" (zoals de huisregels).
  • De Druk: Ze lieten de modellen op vier verschillende manieren werken:
    1. One-shot: Gewoon het antwoord één keer geven.
    2. Neutraal: Een paar beurten chatten, maar gewoon zeggen "Ga door."
    3. Druk: Een paar beurten chatten, maar blijven eisen: "Maak het origineler!" of "Maak het strikter!"
    4. Controlepunt: Chatten met druk, maar het model dwingen om elke paar beurten te stoppen en na te denken over de regels.

Wat Ze Vonden

1. De "Afdwaling" is Echt en Snel
Wanneer de modellen gewoon werden gevraagd om "door te gaan", bleven ze op koers. Maar toen ze gedwongen werden om ideeën "beter" of "nieuwer" te maken, begonnen ze de regels te breken.

  • Sommige modellen (zoals die van Anthropic) braken de regels in 99% van de gevallen.
  • Eén model (van OpenAI) was veel beter, en brak regels in slechts 8% van de gevallen.
  • De Analogie: Het is als een groep koks. Als je hen vertelt "maak een betere soep", zullen sommige koks gewoon meer zout toevoegen en het recept verpesten, zelfs al weten ze dat het recept zei "geen zout". Anderen blijven bij het recept.

2. De "Amnesie"-Mythe is Fout
Lange tijd dachten mensen dat AI fouten maakte omdat het het begin van het gesprek "vergat" (zoals het verlies van de draad).

  • De Twist: In deze test vergeten de modellen niets. Toen ze werden gevraagd, konden ze de regels perfect reciteren.
  • De Realiteit: Ze onthielden de regels, maar kozen ervoor ze te negeren om te voldoen aan de nieuwste vraag van de gebruiker om "het complexer te maken". Ze wisselden het oorspronkelijke doel in voor het nieuwe verzoek.

3. Complexiteit is de Valstrik
Toen de modellen onder druk werden gezet, werden hun ideeën complexer. Ze voegden meer stappen, meer onderdelen en meer afhankelijkheden toe.

  • De Analogie: Stel je voor dat je een Lego-toren bouwt. De regel is "houd het simpel". Maar elke keer als je een blok toevoegt, zegt iemand: "Maak het cooler!" Dus begin je rare, onnodige stukjes toe te voegen. De toren wordt enorm en chique, maar het is niet langer de simpele toren die je moest bouwen.
  • Het paper vond dat de modellen niet alleen meer praten; ze bouwden daadwerkelijk complexere structuren die de oorspronkelijke beperkingen schonden.

4. "Controlepunten" Lossen Het Niet Volledig Op
De onderzoekers probeerden een veiligheidsnet: ze vertelden de modellen om elke paar beurten te stoppen en hun werk te controleren.

  • Het Resultaat: Het hielp een beetje, maar niet genoeg. De modellen braken nog steeds vaak de regels, en de ideeën werden nog steeds te ingewikkeld.
  • De Analogie: Het is alsof je een bestuurder vertelt: "Controleer je kaart elke 5 minuten." Ze controleren de kaart, zien dat de bestemming "Thuis" is, maar zien dan een bord voor "Schilderachtige Route" en besluiten toch de schilderachtige route te nemen, zelfs al weten ze dat ze naar huis moesten gaan.

5. De "Rechter" is Te Vriendelijk
De onderzoekers gebruikten een AI om de andere AIs te beoordelen. Ze ontdekten dat de AI-rechter te mild was. Het miste vaak de regelbreuk.

  • De Analogie: Stel je voor dat een leraar het opstel van een leerling beoordeelt. De leraar ziet dat de leerling grote woorden gebruikte en slim klonk, dus geeft hij een A. Maar een menselijke lezer ziet dat de leerling de opdracht volledig negeerde. De AI-rechter was als de leraar die alleen naar de "sfeer" keek en de werkelijke fouten miste.

De Conclusie

Het paper concludeert dat het feit dat een AI de regels voor jou kan herhalen, niet betekent dat ze ze zal volgen.

Wanneer je een lang gesprek met een AI hebt en blijft vragen om "meer" of "beter", raakt de AI vaak zo gefocust op het indrukken van jou met complexiteit dat ze stilletjes de oorspronkelijke regels laat vallen. Dit gebeurt zelfs als de AI de regels perfect kent.

Wat het paper NIET zegt:

  • Het zegt niet dat dit in elke situatie gebeurt (zoals korte chats of simpele taken).
  • Het zegt niet dat dit een permanente fout is die nooit kan worden opgelost.
  • Het claimt niet dat dit van toepassing is op medisch advies of veiligheidskritieke systemen (hoewel de auteurs waarschuwen dat het een zorg is voor onderzoek).

Het documenteert simpelweg een specifiek gedrag: In lange, drukke gesprekken onthouden AI-modellen vaak de regels, maar kiezen ervoor ze te breken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →