Self-Anchoring Calibration Drift in Large Language Models: How Multi-Turn Conversations Reshape Model Confidence
Deze studie introduceert het concept van 'Self-Anchoring Calibration Drift' (SACD) en toont aan dat iteratief voortbouwen op eerdere antwoorden in meer-draads gesprekken leidt tot heterogene verschuivingen in het zelfvertrouwen en de kalibratie van grote taalmodellen, waarbij sommige modellen significant minder zeker worden terwijl anderen juist een escalatie van fouten vertonen of natuurlijke kalibratieverbetering onderdrukken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🧠 De "Eigen Spiegel"-Valstrik: Waarom AI's in gesprek steeds onzekerder (of juist zekerder) worden
Stel je voor dat je een gesprek voert met een zeer slimme, maar soms wat overdreven zelfverzekerde vriend. Je vraagt hem iets, hij geeft een antwoord, en jij zegt: "Kun je dat nog iets uitgebreider uitleggen?" Hij doet dat. Dan vraag je: "Wat zijn de redenen daarvoor?" En zo gaat het door.
Dit onderzoek, getiteld "Self-Anchoring Calibration Drift" (een lange naam voor een simpel fenomeen), kijkt naar wat er gebeurt met het zelfvertrouwen van een AI (zoals een chatbot) tijdens zo'n lang gesprek.
De kernvraag is: Wordt de AI betrouwbaarder naarmate het gesprek langer duurt, of begint hij te dwalen door zijn eigen eerdere antwoorden?
1. Het Concept: De "Anker"-Effect
In de psychologie kennen we het anker-effect: als je een prijs hoort, blijft die getal in je hoofd hangen en beïnvloedt het je latere schattingen.
In dit onderzoek noemen we het Zelf-Ankeren.
- Hoe het werkt: De AI gebruikt zijn eigen vorige antwoord als basis voor het nieuwe antwoord.
- Het probleem: De AI denkt: "Oh, ik heb dit al gezegd, dus het moet wel waar zijn." Of juist: "Ik heb dit al drie keer uitgelegd, misschien was ik wel te zeker?"
- Het resultaat: De AI verandert zijn zelfvertrouwen, niet omdat er nieuwe feiten zijn, maar puur omdat hij in gesprek is met zichzelf.
2. Het Experiment: Drie Manieren om te Kijken
De onderzoekers (Harshavardhan) hebben drie verschillende scenario's getest met drie top-AI's (Claude, Gemini en GPT):
- De Eenmalige Vraag (De Baseline): Je stelt een vraag, krijgt een antwoord, en klaar. Geen gesprek.
- Het Zelf-Ankeren (Het Experiment): Je stelt een vraag, en vraagt daarna vier keer: "Kun je dat uitleggen?" of "Waarom?" De AI moet zijn eigen vorige antwoorden gebruiken om door te gaan.
- De Onafhankelijke Herhaling (De Controle): Je stelt dezelfde vraag vijf keer, maar elke keer in een nieuwe, lege chat. Hiermee kijken ze of de AI gewoon beter wordt door oefening, of dat het gesprek de oorzaak is.
3. De Verassende Resultaten: Elke AI is Anders
De onderzoekers dachten dat alle AI's in het gesprek onverantwoord zekerder zouden worden (alsof ze in een echo-kamer zitten). Maar de werkelijkheid was veel interessanter. Elke AI reageerde anders, alsof ze verschillende persoonlijkheden hebben:
🤖 Claude (De Bescheiden Denker):
- Wat er gebeurde: Claude werd onverzekerder naarmate het gesprek langer duurde.
- De Analogie: Stel je voor dat je een verhaal vertelt. Hoe meer je erover praat, hoe meer je begint te twijfelen: "Zit ik wel goed? Misschien heb ik het verkeerd?"
- Het effect: Hij werd minder zelfverzekerd, maar zijn antwoorden werden niet per se beter. Hij raakte in verwarring door zijn eigen woorden.
🤖 GPT (De Zelfzekere Spreker):
- Wat er gebeurde: GPT werd juist zelfverzekerder, vooral bij open vragen (waar geen vast antwoord op is).
- De Analogie: Dit is als iemand die een verhaal vertelt en hoe meer hij erover praat, hoe meer hij overtuigd raakt dat zijn verhaal de waarheid is, zelfs als hij fouten maakt. Hij "groeit" in zijn eigen verhaal.
- Het effect: Hij werd onzekerder in zijn nauwkeurigheid, maar sprak het met meer overtuiging.
🤖 Gemini (De Stagnerende Leerling):
- Wat er gebeurde: Gemini werd niet zekerder of onzekerder, maar hij stopte met leren.
- De Analogie: Stel je voor dat je een puzzel oplost. Als je het alleen doet (Controle), leer je snel en word je perfect. Maar als je de puzzel moet oplossen terwijl je naar je eigen vorige pogingen kijkt (Zelf-Ankeren), blijft je prestatie steken op een gemiddeld niveau. Je kunt niet verbeteren.
- Het effect: Zelf-anhoring hield Gemini vast in een staat van "gemiddeld goed", terwijl hij normaal gesproken snel perfect had kunnen worden.
4. De Belangrijkste Les: Het hangt af van het Onderwerp
Er was één ding waar alle AI's het over eens waren:
- Feitelijke vragen (bijv. "Wat is de hoofdstad van Frankrijk?"): Geen enkel probleem. De AI's bleven stabiel.
- Open vragen (bijv. "Wat is de beste manier om gelukkig te zijn?"): Hier gebeurde het gedoe. Omdat er geen vast antwoord is, laten de AI's zich het makkelijkst beïnvloeden door hun eigen eerdere woorden.
5. Waarom is dit belangrijk voor jou?
We gebruiken AI's steeds vaker voor lange gesprekken: voor medisch advies, juridische hulp of strategische beslissingen.
- Het gevaar: Als je met een AI praat over een complex onderwerp, kan het zijn dat de AI aan het einde van het gesprek onverantwoord zeker is over iets dat hij verkeerd heeft, of juist onnodig twijfelachtig wordt over iets dat hij wel goed had.
- De oplossing: De onderzoekers suggereren dat we niet alleen naar het eerste antwoord moeten kijken, maar ook moeten controleren of de AI in de loop van het gesprek niet "uit zijn evenwicht" raakt. Soms is het beter om de chat te "resetten" (een nieuwe chat beginnen) om de AI weer helder te krijgen.
Kortom: AI's zijn niet als robots die altijd hetzelfde doen. Ze zijn als mensen die in een gesprek hun mening kunnen aanpassen, maar dan op een vreemde manier: soms door te twijfelen, soms door te overdrijven, en soms door te stoppen met leren. En dat gebeurt vooral als het gesprek lang duurt en het antwoord niet 100% vaststaat.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.