← Nieuwste papers
🤖 AI

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

Dit artikel introduceert C3RL, een reinforcement learning-algoritme dat zowel de nauwkeurigheid als de kalibratie van grote taalmodellen verbetert, en maakt gebruik van deze goed gekalibreerde betrouwbaarheidsscores om CAS aan te sturen, een adaptieve strategie voor schaling tijdens de inferentietijd die de inferentiekosten aanzienlijk vermindert terwijl het bestaande methoden overtreft.

Oorspronkelijke auteurs: Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

Gepubliceerd 2026-07-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar overmoedige student hebt die een zeer moeilijk examen aflegt. Deze student, een AI, is geweldig in het oplossen van problemen, maar heeft een slechte gewoonte: wanneer hij het antwoord niet zeker weet, gokt hij toch en zegt hij met een strak gezicht: "Ik ben 100% zeker!" In de wereld van AI wordt dit een "hallucinatie" genoemd. Het is alsoğ met de student die vol vertrouwen "De hoofdstad van Frankrijk is Londen" schrijft en het fout heeft.

Het artikel dat je hebt gedeeld, introduceert een tweestapsysteem om het gedrag van deze student te corrigeren en zijn studietijd efficiënter te maken.

Stap 1: De "Eerlijkheidscoach" (C3RL)

Het eerste deel van de oplossing is een nieuwe trainingsmethode genaamd C3RL (Correctness and Confidence Calibration Reinforcement Learning). Zie dit als een strenge maar eerlijke coach die de student twee dingen tegelijk leert:

  1. Krijg het antwoord goed. (Gok niet zomaar.)
  2. Wees eerlijk over hoe zeker je bent. (Als je aan het gokken bent, geef dat dan toe.)

Normaal gesproken, wanneer we AI trainen, belonen we ze alleen voor het geven van het juiste antwoord. Dit maakt hen wanhopig om gelijk te hebben, waardoor ze liegen over hun zelfvertrouwen. C3RL verandert de regels. Het geeft de student een "gouden ster" als ze het antwoord goed hebben én zeggen dat ze het zeker weten. Het geeft ze een "gouden ster" als ze het fout hebben, maar toegeven dat ze het niet zeker weten.

Echter, het geeft ze een "grote rode F" als ze het fout hebben, maar beweren dat ze 100% zeker zijn. Het geeft ze ook een "grote rode F" als ze het goed hebben, maar beweren dat ze totaal geen idee hebben.

Het resultaat? De AI leert te zeggen: "Ik weet het niet zeker over deze," wanneer hij eigenlijk aan het gokken is, en: "Ik ben erg zeker van mijn zaak," wanneer hij het antwoord weet. Het stopt het "zelfverzekerd liegen."

Stap 2: De "Slimme Budgetbeheerder" (CAS)

Zodra de student heeft geleerd om eerlijk te zijn, komt het tweede deel van het systeem in actie. Dit wordt CAS genoemd (Confidence-based Adaptive Test Time Scaling).

Stel je voor dat jij de docent bent die het examen nakijkt, maar je hebt een beperkt budget aan tijd en energie. Je kunt niet 10 uur aan elke vraag besteden.

  • De Oude Manier (Majority Voting): Je vraagt de student om elke vraag 64 keer te beantwoorden en neemt het meest voorkomende antwoord. Dit is accuraat, maar ongelooflijk verspillend. Het is alsof je een student vraagt om een wiskundeprobleem 64 keer op te lossen, alleen maar om zeker te zijn.
  • De Nieuwe Manier (CAS): Je vraagt de student om een vraag één keer te beantwoorden.
    • Als de student zegt: "Ik ben 90% zeker dat het A is," vertrouw je ze direct, schrijf je het antwoord op en ga je door. Je hebt tijd bespaard!
    • Als de student zegt: "Ik ben slechts 40% zeker," weet je dat ze worstelen. Dus je vraagt hen om het opnieuw te proberen, en weer, en weer, totdat ze er zeker van zijn of totdat je genoeg keren hebt geprobeerd.

Omdat de student (de AI) dankzij Stap 1 nu eerlijk is over zijn zelfvertrouwen, kun je hun "ik weet het zeker"-signalen vertrouwen. Dit stelt je in staat om geen tijd te verspillen aan makkelijke vragen en je energie alleen te richten op de moeilijke vragen.

Het Grote Resultaat

Het artikel laat zien dat deze combinatie wonderen verricht:

  1. Betere Eerlijkheid: De AI werd veel beter in het weten wanneer hij het antwoord niet wist, zonder dat dit ten koste ging van het daadwerkelijk oplossen van de problemen.
  2. Enorme Besparingen: Door de "Slimme Budgetbeheerder" te gebruiken, bespaarde het systeem een enorme hoeveelheid rekenkracht. In sommige tests gebruikte het 12 keer minder computerbronnen dan de oude methode, terwijl het dezelfde (of betere) resultaten behaalde.

Kortom, het artikel leert AI om te stoppen met bluffen over wat ze weten, en gebruikt die eerlijkheid vervolgens om tijd en geld te besparen door alleen hard te werken wanneer dat daadwerkelijk nodig is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →