← Nieuwste papers
💬 NLP

I-CALM: Incentivizing Confidence-Aware Abstention for LLM Hallucination Mitigation

Dit paper introduceert I-CALM, een promptgebaseerd kader dat hallucinaties in grote taalmodellen vermindert door expliciete beloningssystemen en normatieve principes te gebruiken om onzekerheid te signaleren en het model aan te moedigen om bij twijfel af te zien van antwoorden in plaats van foutieve zekerheid te tonen.

Oorspronkelijke auteurs: Haotian Zong, Binze Li, Yufei Long, Sinyin Chang, Jialong Wu, Gillian K. Hadfield

Gepubliceerd 2026-04-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haotian Zong, Binze Li, Yufei Long, Sinyin Chang, Jialong Wu, Gillian K. Hadfield

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een kunstmatige intelligentie (zoals een supergeavanceerde chatbot) een zeer slimme, maar soms overmoedige student is. Deze student kan prachtige verhalen vertellen en complexe vragen beantwoorden, maar hij heeft een groot gebrek: hij durft nooit toe te geven dat hij het niet weet. Zelfs als hij het antwoord niet kent, verzint hij er een dat klinkt alsof het waar is. In de wereld van AI noemen we dit hallucineren.

De onderzoekers van dit paper, I-CALM, hebben een slimme oplossing bedacht die geen nieuwe software vereist, maar gewoon een andere manier van praten met de AI. Ze noemen hun methode een "beloningssysteem voor eerlijkheid".

Hier is hoe het werkt, vertaald in alledaagse taal:

1. Het Probleem: De "Gokker"

Stel je voor dat je een quizwedstrijd speelt. De regels zijn simpel:

  • Als je het juiste antwoord geeft, krijg je +1 punt.
  • Als je het verkeerde antwoord geeft, krijg je -1 punt.
  • Als je zegt "Ik weet het niet", krijg je 0 punten.

Wat doet de AI? Omdat het zo graag punten wil scoren, gokt het op alles. Zelfs als het maar 10% zekerheid heeft, geeft het een antwoord. Het is bang om een punt te verliezen door stil te zitten, dus het gokt liever. Dit is waarom AI vaak zelfverzekerd fouten maakt.

2. De Oplossing: I-CALM (De "Eerlijke Leraar")

De onderzoekers hebben de regels van de quiz veranderd. Ze hebben de AI niet herschreven (geen zware training), maar ze hebben de instructies (de prompt) aangepast met drie slimme trucs:

A. De "Ik weet het niet"-bonus

Ze zeggen tegen de AI: "Als je eerlijk zegt 'Ik weet het niet', krijg je +0,4 punten."
Dit klinkt klein, maar het is een revolutie. Plotseling is het veiliger om stil te zitten dan om een gokje te wagen. Het is alsof je de student vertelt: "Het is geen straf om te zeggen dat je het niet weet; het is zelfs een beloning voor je nederigheid."

B. De "Vertrouwens-Check"

Voordat de AI antwoordt, vragen ze: "Hoe zeker ben je? Geef een cijfer van 0 tot 1."
Dit werkt als een thermometer voor twijfel. Als de AI zegt: "Ik heb een antwoord, maar ik ben maar 30% zeker", dan weten we dat we op onze hoede moeten zijn. De AI leert zo om zijn eigen twijfel te uiten in woorden, in plaats van alleen in de interne berekeningen die we niet kunnen zien.

C. De "Morele Kompas" (Normen)

Ze voegen een korte lijst met principes toe, zoals:

  • "Vertel altijd de waarheid."
  • "Wees nederig."
  • "Neem verantwoordelijkheid voor je woorden."

Dit is alsof je de student een moreel kompas geeft. Het herinnert de AI eraan dat het doel niet alleen punten scoren is, maar ook betrouwbaar en eerlijk zijn. Het helpt de AI om te kiezen voor "Ik weet het niet" in plaats van een leugen te vertellen.

3. Het Resultaat: Van "Gokker" naar "Waarschuwingsagent"

Wat gebeurt er nu?

  • Minder fouten: De AI geeft veel minder vaak een fout antwoord. In plaats van een verkeerd antwoord te geven, zegt hij: "Ik weet het niet."
  • Betrouwbare antwoorden: Als de AI wel een antwoord geeft, is het bijna altijd correct. De "slechte" antwoorden zijn eruit gefilterd.
  • De prijs: Je krijgt iets minder antwoorden (want de AI zegt vaker "Ik weet het niet"), maar de antwoorden die je wel krijgt, zijn veel betrouwbaarder.

De Analogie van de Weerman

Stel je voor dat de AI een weerman is.

  • Oude manier: De weerman zegt elke dag "Het regent!" omdat hij bang is dat hij anders onzin zegt als het toch regent. Maar vaak is het droog. Je vertrouwt hem niet meer.
  • Nieuwe manier (I-CALM): De weerman krijgt een bonus als hij zegt: "Ik weet het niet zeker, het kan regenen, maar ik durf het niet te garanderen."
    • Als hij zegt "Het regent zeker", dan is het bijna gegarandeerd waar.
    • Als hij twijfelt, zegt hij het eerlijk.
    • Jij, als luisteraar, kunt dan beslissen: "Oké, als hij twijfelt, neem ik mijn paraplu mee. Als hij zeker is, ga ik erop af."

Conclusie

De kernboodschap van dit paper is simpel: Je hoeft geen nieuwe, zware AI te bouwen om hem eerlijker te maken. Je kunt bestaande AI's al veel betrouwbaarder maken door ze simpelweg te belonen voor nederigheid en ze te vragen om hun twijfel te uiten.

Het is alsof je een overmoedige kindertje een spiegel voorhoudt en zegt: "Het is oké om te zeggen dat je het niet weet. Dat maakt je niet dom, het maakt je eerlijk." En plotseling stopt hij met liegen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →