← Nieuwste papers
🤖 machine learning

From Drift to Coherence: Stabilizing Beliefs in LLMs

Dit artikel toont aan dat hoewel grote taalmodellen aanvankelijk belief drift vertonen die de martingale-eigenschap schendt tijdens autoregressieve antwoordresampling, ze uiteindelijk zelfstabiliseren naar coherente predictieve distributies, een fenomeen dat wordt benut om prompting- en fine-tuningstrategieën voor te stellen die drift verminderen en coherentie verbeteren zonder nauwkeurigheid op te offeren.

Oorspronkelijke auteurs: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde robot hebt (een Large Language Model of LLM) waar je een vraag aan stelt. Meestal verwacht je dat de robot een antwoord geeft en zich aan zijn redenering houdt. Maar dit artikel ontdekt iets vreemds: als je de robot vraagt om herhaaldelijk achter elkaar hetzelfde antwoord op dezelfde vraag te geven, wankelt zijn zelfvertrouwen.

Hier is het verhaal van hoe de auteurs die wankeling hebben opgelost, eenvoudig uitgelegd.

Het Probleem: Het "Wankele Brein" van de Robot

Denk aan het brein van de robot als een persoon die probeert het weer te voorspellen.

  1. Het Ideaal: Als de robot een perfecte Bayesiaanse denker zou zijn (een chique term voor een perfecte probabilistische gokker), zou zijn zelfvertrouwen stabiel moeten zijn. Als hij denkt dat er 70% kans is op regen, zou die 70% niet mogen veranderen alleen omdat hij er een seconde later weer over nadenkt.
  2. De Realiteit: De auteurs ontdekten dat wanneer ze de robot vroegen om een reeks antwoorden op dezelfde vraag te genereren, zijn interne zelfvertrouwen dreef.
    • Analogie: Stel je voor dat je een vriend vraagt: "Gaat het regenen?" Hij zegt: "Ik weet het voor 70% zeker." Dan, zonder opnieuw naar buiten te kijken, vraag je het hem direct nog een keer. Hij zegt plotseling: "Eigenlijk weet ik het maar voor 50% zeker." Dan vraag je het hem weer en zegt hij: "Wacht, misschien wel 80%!"
    • Dit "wankelen" betekent dat de overtuigingen van de robot op de korte termijn onstabiel zijn. Het is als een kompas dat wild ronddraait voordat het eindelijk naar het Noorden wijst.

De Ontdekking: Het Zakt Uiteindelijk Wel In

De onderzoekers merkten iets interessants op: als je de robot heel vaak dezelfde vraag liet beantwoorden (bijvoorbeeld 20 of 30 keer achter elkaar), stopte de wankeling uiteindelijk. Het zelfvertrouwen van de robot zou stabiliseren en een consistent getal bereiken.

  • De Metafoor: Het is als het schudden van een pot met gemengde knikkers. In het begin tollen de kleuren chaotisch rond. Maar als je de pot even laat staan, zakken de knikkers naar benede en kun je eindelijk de ware verhouding van de kleuren zien. De robot heeft een "settling period" (een burn-in fase genoemd) nodig om zijn ware overtuiging te vinden.

De Oplossing: Twee Trucs om de Wankeling te Stoppen

Het probleem is dat wachten tot de robot tot rust is lang duurt en veel computerkracht kost. De auteurs bedachten twee manieren om de robot direct stabiel te maken.

1. De "Opwarm"-truc (Answer Seeding)

In plaats van de robot koud te laten beginnen, geeft de auteur eerst een "opwarmlijst" met antwoorden.

  • Hoe het werkt: Ze vragen de robot om eerst één keer een paar willekeurige antwoorden op de vraag te genereren, en vervolgens voeden ze die antwoorden terug aan de robot als onderdeel van de prompt voordat ze de echte reeks vragen.
  • De Analogie: Het is als een muzikant die zijn instrument stemt voor een concert. In plaats van het liedje te beginnen met een schorre, vals gestemde noot, speelt hij een paar snelle noten om de juiste toonhoogte te krijgen. De robot gebruikt deze "seed"-antwoorden om direct in de stabiele zone te springen, waardoor de chaotische wankeling aan het begin wordt overgeslagen.

2. De "Trainings"-truc (Self-Consistency Loss)

De auteurs leerden de robot ook om stabiel te zijn door de manier waarop hij leert te veranderen.

  • Hoe het werkt: Ze creëerden een speciale wiskundige les (een "loss function") waarbij ze de robot zijn eigen toekomstige antwoorden lieten zien. Ze zeiden tegen de robot: "Jouw antwoord op dit moment moet overeenkomen met wat je over 5 stappen zult zeggen."
  • De Analogie: Stel je een student voor die meestal nerveus wordt en van gedachten verandert tijdens een toets. De leraar geeft hen de regel: "Wat je ook bij vraag #1 opschrijft, je moet daarover kunnen staan wanneer je bij vraag #10 bent." Door deze regel te oefenen, leert de student om vanaf de allereerste seconde consistent te zijn, zodat ze niet hoeven te "wankelen" om hun zelfvertrouwen te vinden.

De Resultaten

Toen ze deze trucs testten op standaard meerkeuzevragen (zoals algemene kennis of wetenschappelijke quizzen):

  • Minder Wankelen: Het zelfvertrouwen van de robot stopte met drijven en bleef consistent.
  • Beter Gokken: De robot werd beter in het weten hoe zeker hij was van zijn antwoorden (kalibratie).
  • Dezelfde Nauwkeurigheid: Cruciaal is dat het stabieler maken van de robot hem niet dommer maakte. Hij gaf nog steeds even vaak de juiste antwoorden als voorheen, maar hij was nu betrouwbaarder over wanneer hij het bij het rechte eind was.

De Kernboodschap

Het artikel laat zien dat hoewel AI-modellen vaak beginnen met een "wankel" overtuigingssysteem bij het genereren van reeksen, ze van nature naar consistentie streven. Door een beetje "opwarm"-data te gebruiken of door ze te trainen om overeen te komen met hun toekomstige zelf, kunnen we ze direct stabiel en betrouwbaar maken, zonder dat we hoeven te wachten tot ze uit zichzelf tot rust komen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →