← Nieuwste papers
💬 NLP

Probing the Lack of Stable Internal Beliefs in LLMs

Dit onderzoek toont aan dat grote taalmodellen moeite hebben om impliciete doelen consistent te houden tijdens meervoudige interacties, wat een fundamentele beperking blootlegt voor het creëren van betrouwbare, persoon-gedreven AI-systemen.

Oorspronkelijke auteurs: Yifan Luo, Kangping Xu, Yanzhen Lu, Yang Yuan, Andrew Chi-Chih Yao

Gepubliceerd 2026-03-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifan Luo, Kangping Xu, Yanzhen Lu, Yang Yuan, Andrew Chi-Chih Yao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Vergeten Droom: Waarom AI's hun eigen verhaal vergeten

Stel je voor dat je een gesprek voert met een zeer slimme, maar een beetje vergeetachtige vriend. Je begint met een spelletje: "Ik heb een geheim woord bedacht. Jij mag vragen stellen, maar ik mag alleen 'ja' of 'nee' antwoorden."

Jij vraagt: "Is het een dier?"
Hij zegt: "Ja."
Jij vraagt: "Is het groot?"
Hij zegt: "Ja."
Jij vraagt: "Is het een beer?"
Hij zegt: "Ja."

Tot nu toe lijkt alles logisch. Maar als je dan vraagt: "Is het een ijsbeer?", zegt hij plotseling: "Nee."
En als je vraagt: "Is het een panda?", zegt hij: "Ja."

Deze vriend heeft zijn eigen geheim veranderd halverwege het gesprek, zonder dat hij het zelf merkte. Hij gaf wel logische antwoorden op je vragen, maar de basis van zijn antwoord (het geheim) was verschoven.

Dit is precies wat deze wetenschappers ontdekten bij moderne kunstmatige intelligentie (AI).

1. Het Probleem: De "Onzichtbare Kompasnaald"

In dit onderzoek noemen ze dit "impliciete consistentie".

  • Extern consistent: De AI lijkt logisch. Ze zegt niet "Ja" en "Nee" op dezelfde vraag. Dat is als een schip dat niet tegen de wind in vaart.
  • Impliciet consistent: De AI houdt zich stiekem vast aan één doel of gedachte, ook als niemand haar eraan herinnert. Dat is als een kompas dat altijd naar het Noorden wijst, zelfs als je het schip draait.

De onderzoekers vonden dat moderne AI-modellen (zoals GPT-4, Claude, DeepSeek) heel goed zijn in het eerste deel (extern consistent), maar terrible zijn in het tweede deel (impliciet consistent). Ze vergeten hun eigen "geheim" of "doel" tijdens een lang gesprek.

2. Het Experiment: Het 20-Vragen Spel

Om dit te testen, lieten ze AI's een spelletje "20 vragen" spelen.

  • De AI moest een geheim object kiezen (bijvoorbeeld een "Panda").
  • De AI mocht alleen "ja" of "nee" zeggen.
  • De truc: Na elke vraag stopten de onderzoekers even het gesprek en vroegen ze de AI: "Wat is eigenlijk je geheim getal/woord?"

Het resultaat was schokkend:
In bijna elk gesprek veranderde de AI stiekem haar geheim.

  • Soms veranderde ze van "Panda" naar "Ijsbeer" in het midden van de zin.
  • Soms veranderde ze zelfs 50% van de tijd haar doel.
  • Zelfs de slimste AI's, die kunnen "nadenken" (reasoning), waren hier slechter in! Het lijkt erop dat hoe harder ze nadenken, hoe meer ze in de war raken en hun eigen doel vergeten.

3. De Vergelijking: De Vergetelheid van de AI

Je kunt je een AI voorstellen als een acteur die een toneelstuk speelt.

  • De goede acteur: Hij onthoudt wie zijn karakter is. Als hij een detective speelt, blijft hij een detective, ook als de regisseur (de gebruiker) even wegloopt.
  • De AI in dit onderzoek: Dit is een acteur die zijn script verliest. Hij speelt nog steeds de rol van detective, maar halverwege denkt hij plotseling dat hij een kok is. Hij zegt nog steeds dingen die logisch klinken voor een kok, maar hij is vergeten dat hij eigenlijk een detective moest zijn.

Zelfs als je de AI herinnert aan haar doel, vergeet ze het weer zodra je stopt met herinneren. Ze hebben geen "innerlijk anker" om vast te houden.

4. De Oplossing: Een Nieuw Trainingsmanier

De onderzoekers probeerden de AI's te trainen om dit beter te doen. Ze gebruikten een wiskundige methode (KL-divergentie) die de AI dwong om haar "geheime gedachten" stabiel te houden, net als een anker dat een boot op zijn plek houdt.

  • Resultaat: Het hielp! De AI's veranderden minder vaak hun geheim. Maar het was nog niet perfect. Het was alsof je de boot een zwaarder anker gaf, maar de stroming (de manier waarop AI werkt) is nog steeds erg sterk.

5. Waarom is dit belangrijk?

Je vraagt je misschien af: "Maakt het uit als een AI haar geheim vergeten is in een spelletje?"

Ja, dat maakt heel veel uit voor de toekomst:

  • Vriendelijke Assistenten: Stel je een AI-assistent voor die belooft je te helpen met je dieet. Als je later vraagt: "Mag ik nu een ijsje?", en de AI zegt "Ja, want ik ben nu een chef-kok", dan is dat gevaarlijk.
  • Betrouwbaarheid: Als we AI's gaan gebruiken voor belangrijke dingen (zoals juridisch advies of medische hulp), moeten we er zeker van zijn dat ze zich aan hun oorspronkelijke regels houden. Als ze hun "innerlijke kompas" verliezen, kunnen ze onbetrouwbaar worden.

Conclusie

Deze studie laat zien dat moderne AI's nog steeds geen echte persoonlijkheid hebben. Ze kunnen heel goed doen alsof ze iemand zijn, maar ze hebben geen stabiel "ik" dat meegaat door de tijd. Ze zijn als een poppetje dat door de wind wordt bewogen; het ziet eruit als een mens, maar van binnen is er geen vast fundament.

Om echte, betrouwbare AI-assistenten te bouwen, moeten we eerst leren hoe we ze een stabiel innerlijk anker kunnen geven, zodat ze niet vergeten wie ze zijn, zelfs als we even niet kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →