← Nieuwste papers
💬 NLP

Aligning Language Models with Selective Prediction

Dit artikel stelt Reinforcement Learning for Selection Reward (RLSR) voor, een nieuw post-training alignment-framework dat grote taalmodellen optimaliseert voor selectieve voorspelling door direct te richten op de oppervlakte onder de risico-dekkingcurve (AURC), waardoor de risico-dekking-trade-off aanzienlijk wordt verbeterd en de betrouwbaarheid in scenario's met hoge inzet wordt versterkt.

Oorspronkelijke auteurs: Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De Overmoedige AI

Stel je voor dat je een zeer slimme maar overmoedige assistent inhuurt om je te helpen bij belangrijke beslissingen, zoals het diagnosticeren van een patiënt of het analyseren van een aandeel. Deze assistent (de AI) is geweldig in het beantwoorden van vragen, maar heeft een slechte gewoonte: hij geeft nooit toe dat hij het niet weet. Zelfs als hij aan het gokken is, spreekt hij met 100% zekerheid.

In situaties met een hoog risico (zoals in de rechtspraak of de geneeskunde) is een zelfverzekerde fout gevaarlijk. Je hebt liever dat de assistent zegt: "Ik weet het niet zeker, laat een mens dit even controleren," dan dat hij je vol vertrouwen het verkeerde antwoord geeft. Dit is de kern van het probleem dat dit artikel aanpakt: Hoe leren we een AI om te weten wanneer hij stil moet blijven?

De Oplossing: "Selectieve Voorspelling"

Het artikel stelt een strategie voor genaamd Selectieve Voorspelling (Selective Prediction). Denk hierbij aan het leren van de AI om een "selectief filter" te zijn.

In plaats van elke vraag te beantwoorden, wordt de AI getraind om:

  1. Alleen de vragen te beantwoorden waar hij zeer zeker van is.
  2. Zich te onthouden (te zeggen "Ik weet het niet") bij de vragen waar hij onzeker over is.

Door de risicovolle gokken weg te filteren, stijgt de algehele nauwkeurigheid van de AI op de vragen die hij wel beantwoordt aanzienlijk.

Waarom Vorige Methoden Niet Werkten

De auteurs leggen uit dat eerdere pogingen om dit op te lossen vertrouwden op Kalibratie.

  • De Kalibratie-analogie: Stel je een weerman voor die zegt: "Er is een kans van 70% op regen." Als het in 7 van de 10 gevallen regent wanneer hij dat zegt, is hij "gekalibreerd".
  • De Gebrekkigheid: Het artikel betoogt dat "gekalibreerd" zijn niet genoeg is. Je kunt een weerman hebben die perfect gekalibreerd is, maar die een "misschien"-antwoord nog steeds hoger inschat dan een "definitief"-antwoord.
  • Het Inzicht van het Artikel: Wat je echt nodig hebt is niet alleen een weerman die eerlijk is over zijn kansen; je hebt een rechter nodig die antwoorden perfect kan sorteren van "meest waarschijnlijk juist" naar "meest waarschijnlijk onjuist". Het artikel noemt dit Selectieve Voorspelling, en het is een ander doel dan alleen "gekalibreerd" zijn.

De Nieuwe Methode: RLSR (Reinforcement Learning voor Selectiebeloning)

De auteurs hebben een nieuwe trainingsmethode ontwikkeld genaamd RLSR. Hier is hoe het werkt, met een eenvoudige metafoor:

De "Sorteerhoed"-analogie:
Stel je voor dat de AI een student is die een toets maakt.

  • Oude Methode (RLVR): De leraar geeft alleen punten voor het juiste antwoord. Als de student correct gokt, krijgt hij een punt. Als de student het fout heeft, krijgt hij niets. De student leert om alles te beantwoorden, zelfs als hij maar aan het gokken is.
  • Nieuwe Methode (RLSR): De leraar verandert de regels. De leraar geeft niet alleen om of het antwoord juist of onjuist is; de leraar geeft om de rangschikking.
    • De leraar kijkt naar al de antwoorden van de student en zegt: "Ik wil dat de antwoorden waarvan je het meest zeker bent, de juiste zijn, en de antwoorden waarvan je het minst zeker bent, de onjuiste zijn."
    • Als de student een moeilijke vraag goed beantwoordt maar zegt dat hij slechts "50% zeker" is, krijgt hij een kleine beloning.
    • Als de student een makkelijke vraag fout heeft maar zegt dat hij "99% zeker" is, krijgt hij een enorme straf.
    • Als de student een moeilijke vraag goed beantwoordt en zegt "99% zeker", krijgt hij een enorme beloning.

Deze methode, genaamd RLSR, gebruikt een speciaal scoresysteem (gebaseerd op een metriek genaamd AURC) dat de AI beloont voor het creëren van een duidelijke kloof tussen zijn "zekere" antwoorden en zijn "onzekere" antwoorden.

De Resultaten: Een Beter Filter

Het artikel heeft deze nieuwe methode getest op diverse moeilijke taken (zoals wiskundeproblemen en complexe trivia) en vergeleken met de oude methoden.

  • De Uitkomst: De AI die getraind is met RLSR werd veel beter in het weten wanneer hij moest spreken en wanneer hij stil moest blijven.
  • Het Bewijs: Wanneer de onderzoekers een regel instelden zoals "Beantwoord alleen als je 90% zeker bent", was de met RLSR getrainde AI aanzienlijk nauwkeuriger dan de andere modellen. Het slaagde erin om de "zelfverzekerde fouten" weg te filteren die de andere modellen bleven maken.
  • Real-World Test: Ze hebben het zelfs getest op een medische dataset (MedQA). Wanneer ze de AI dwongen om alleen vragen te beantwoorden waarbij hij een hoog niveau van nauwkeurigheid kon garanderen, was het RLSR-model het enige model dat consistent aan die hoge veiligheidsstandaard kon voldoen.

Samenvatting

Kortom, dit artikel leert AI-modellen om te stoppen met "zelfverzekerd gokken". In plaats van te proberen over alles gelijk te hebben, leert de AI een slimme poortwachter te zijn. Het leert te zeggen: "Dit weet ik," en "Dat weet ik niet," waardoor het gegarandeerd is dat wanneer het spreekt, het zeer waarschijnlijk correct is. Dit maakt AI veel veiliger en betrouwbaarder voor kritieke banen in de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →