← Nieuwste papers
🤖 AI

Confidence Calibration in Large Language Models

Dit artikel presenteert een vooraf geregistreerde studie die aantoont dat grote taalmodellen een algemene neiging tot overmoed vertonen, welke wordt gemoduleerd door een moeilijk-makkelijk-effect waarbij overmoed piekt bij moeilijke taken terwijl ondermoed optreedt bij makkelijke taken, wat leidt tot de ontwikkeling van de LifeEval-benchmark voor het beoordelen van kalibratie over verschillende moeilijkheidsgraden.

Oorspronkelijke auteurs: Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Kernprobleem: De Zekerheidszuchtige Student

Stel je een student voor die een reeks toetsen maakt. Soms krijgt deze student een vraag goed en zegt: "Ik ben 100% zeker!" (wat goed is). Maar vaak krijgt hij een vraag fout en zegt toch: "Ik ben 100% zeker!" (wat slecht is).

Dit artikel onderzoekt of Large Language Models (LLM's) — de hersenen achter AI-chatbots — zich gedragen als die zekerheidszuchtige student. De onderzoekers ontdekten dat AI-modellen gemiddeld te zeker zijn van hun gelijk. Ze beweren vaker correct te zijn dan ze in werkelijkheid zijn. Dit is gevaarlijk omdat je, als je vertrouwen hebt in een model dat zelfverzekerd fout is, misschien een slechte beslissing neemt.

De "Moeilijk-Makkelijk"-Twist

De meest interessante ontdekking in het artikel is een fenomeen dat het "Moeilijk-Makkelijk-effect" wordt genoemd. Denk hierbij aan een wip van zelfvertrouwen:

  • Bij Makkelijke Taken: Wanneer de vragen simpel zijn (zoals "Wat is 2+2?"), zijn de modellen eigenlijk te weinig zelfverzekerd. Ze krijgen het antwoord goed, maar zeggen: "Ik ben maar 60% zeker", terwijl ze 100% zeker zouden moeten zijn. Ze zijn te bescheiden.
  • Bij Moeilijke Taken: Wanneer de vragen erg moeilijk worden (zoals complexe logische puzzels), slaan de modellen door naar de andere kant. Ze krijgen het antwoord fout, maar zeggen: "Ik ben 95% zeker!" Dit is overmatig zelfvertrouwen.

Het artikel toont aan dat naarmate taken moeilijker worden, het zelfvertrouwen van de modellen niet genoeg daalt om overeen te komen met hun dalende nauwkeurigheid. Ze blijven roepen "Ik weet dit!" zelfs wanneer ze worstelen.

De Nieuwe Test: "LifeEval"

Om dit te bestuderen, bedachten de onderzoekers een nieuwe test genaamd LifeEval.

De Analogie: Stel je voor dat je probeert te raden hoe lang een persoon zal leven.

  • De Makkelijke Versie: Je krijgt te horen: "Deze persoon is 80 jaar." Je raadt dat ze tot 85 zullen leven. Het is zeer waarschijnlijk dat ze nog minstens 5 jaar leven. Het model voelt zich hier zelfverzekerd.
  • De Moeilijke Versie: Je krijgt te horen: "Deze persoon is 25 jaar." Je raadt dat ze tot 80 zullen leven. Maar je moet raden precies hoe oud ze zullen worden, binnen slechts 1 jaar. Dit is ongelooflijk moeilijk.

De onderzoekers gebruikten echte overheidsdata (sociale zekerheidstafels voor levensverwachting) om de ware kansen te weten dat een persoon een bepaalde leeftijd bereikt. Vervolgens vroegen ze de AI om de leeftijd te raden en aan te geven hoe zeker ze waren.

Het Resultaat: De AI gedroeg zich precies zoals het hierboven beschreven "Moeilijk-Makkelijk"-patroon.

  • Wanneer de gok makkelijk was (een lange levensverwachting voorspellen voor een 80-jarige), was de AI te weinig zelfverzekerd.
  • Wanneer de gok moeilijk was (een specifieke leeftijd voorspellen voor een 25-jarige), was de AI te zeker van zichzelf.

De "Redenerende" versus "Chat"-Modellen

Het artikel testte twee soorten AI-modellen:

  1. "Chat"-Modellen: Dit zijn de standaard, snelle antwoordmodellen.
  2. "Redenerende" Modellen: Dit zijn nieuwere modellen die zijn ontworpen om "na te denken" stap voor stap voordat ze antwoorden (zoals een student die tijd neemt om een wiskundeprobleem op te lossen).

De Bevinding: De "Redenerende" modellen waren hierin veel beter. Ze raakten niet zomaar; ze pasten hun zelfverzekeringsniveaus daadwerkelijk nauwkeuriger aan op basis van hoe moeilijk de taak was. Ze waren minder geneigd om wild zeker van zichzelf te zijn op moeilijke vragen, vergeleken met de standaard "Chat"-modellen.

Waarom Ronden Ze Hun Getallen Af?

De onderzoekers merkten iets grappigs op over hoe de modellen hun zelfvertrouwen rapporteerden.

  • Mensen ronden hun zelfvertrouwen vaak af naar mooie, ronde getallen zoals "80%" of "90%".
  • De AI deed precies hetzelfde! De standaard "Chat"-modellen rondden hun zelfvertrouwen af naar het dichtstbijzijnde 5% in bijna 100% van de gevallen.

Dit suggereert dat de AI menselijk gedrag nabootst, inclusief onze menselijke gewoonte om precieze onzekerheid te vermijden. Het is alsof een student zegt "Ik ben redelijk zeker" in plaats van een specifiek getal te geven, omdat precies zijn riskant voelt.

De "Contaminatie"-Controle

De onderzoekers waren bezorgd dat de AI gewoon de antwoorden op hun nieuwe "LifeEval"-test had onthouden, omdat de data (levensverwachtingstabellen) openbaar is en waarschijnlijk in de trainingsdata van de AI zit.

Ze voerden een "leugendetector"-test uit op de antwoorden van de AI. Ze ontdekten dat sommige geavanceerde modellen (zoals DeepSeek-R1 en Gemini 2.5 Pro) leken te hebben onthouden, wat zich manifesteerde als "sterk bewijs" van valsspelen. Echter, zelfs toen ze de modellen verwijderden die leken te hebben onthouden, bleef het probleem van overmatig zelfvertrouwen bestaan. De modellen waren nog steeds te zeker van zichzelf op moeilijke taken.

Samenvatting

  • Het Hoofdprobleem: AI-modellen zijn over het algemeen te zeker van hun antwoorden, vooral wanneer de taak moeilijk is.
  • Het Patroon: Ze zijn te bescheiden bij makkelijke taken en te arrogant bij moeilijke taken.
  • De Oplossing (Gedeeltelijk): "Redenerende" modellen (die nadenken voordat ze spreken) zijn beter in het kalibreren van hun zelfvertrouwen dan standaard chat-modellen.
  • De Les: We kunnen een AI niet blindelings vertrouwen alleen maar omdat het zeker klinkt. Als een taak moeilijk is, kan de AI zelfverzekerd fout zijn, en moeten we voorzichtig zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →