← Nieuwste papers
💻 computer science

Adaptive Stopping for Multi-Turn LLM Reasoning

Deze paper introduceert MiCP, het eerste raamwerk dat conformele voorspelling toepast op meervoudige conversaties bij grote taalmodellen, waardoor modellen efficiënter kunnen stoppen met redeneren terwijl er een formele garantie blijft bestaan dat het juiste antwoord in de voorspelling zit.

Oorspronkelijke auteurs: Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

Gepubliceerd 2026-04-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een slimme, maar soms overenthousiaste assistent hebt die je helpt bij het oplossen van moeilijke puzzels. Deze assistent is een Grote Taalmodel (LLM).

Soms is het antwoord op je vraag niet direct duidelijk. De assistent moet dan:

  1. Op zoek gaan naar informatie (zoals in een bibliotheek).
  2. Redeneren over wat hij heeft gevonden.
  3. Misschien nog een keer zoeken als het eerste antwoord niet goed genoeg is.

Dit noemen we "multi-turn reasoning" (meerdere rondes van denken en zoeken).

Het Probleem: Wanneer moet hij stoppen?

Het probleem is: Wanneer moet de assistent stoppen met zoeken en het antwoord geven?

  • Te vroeg stoppen: Hij geeft een fout antwoord omdat hij niet genoeg informatie heeft. (Gevaarlijk in situaties zoals gezondheidszorg of financiën).
  • Te lang doorgaan: Hij blijft zoeken tot hij moe wordt, wat tijd kost, geld kost (rekenkracht), en soms zelfs meer fouten introduceert.

Tot nu toe gaven mensen de assistent een vaste regel: "Zoek maximaal 3 keer" of "Stop als je 90% zeker bent." Maar die regels zijn willekeurig. Er is geen garantie dat het antwoord dan ook echt goed is.

De Oplossing: MiCP (De "Zekere Stop")

De auteurs van dit paper hebben MiCP bedacht. Je kunt dit zien als een slimme, wiskundige "stopknop" die altijd de waarheid garandeert binnen een bepaald betrouwbaarheidsniveau.

Hier is hoe het werkt, met een paar creatieve vergelijkingen:

1. De Error Budget (Het "Reisbudget")

Stel je voor dat je een reisplanning maakt met een vast budget aan fouten (bijvoorbeeld: "Ik mag 10% van de tijd een fout maken").

  • De oude manier: Je deelt dit budget gelijkmatig uit over elke dag van de reis. Als je dag 1 al een fout maakt, heb je voor dag 5 niets meer over.
  • De MiCP-methode: Je deelt het budget slim uit.
    • Voor makkelijke vragen (dag 1) geef je een klein budget. Als de assistent snel zeker is, stopt hij direct.
    • Voor moeilijke vragen (dag 5) houd je een groot deel van het budget achter. Hier mag de assistent langer zoeken en meer fouten maken, omdat het antwoord lastiger is.
    • Het resultaat: De assistent stopt zo snel mogelijk, maar het totale risico dat hij een fout antwoord geeft, blijft altijd onder de 10%.

2. De "Can't Answer" Label (De "Ik weet het niet" knop)

Soms is een vraag zo moeilijk dat zelfs na veel zoeken het antwoord niet gevonden wordt.

  • In het verleden probeerden modellen dan toch een gokje te wagen, wat vaak fout ging.
  • Met MiCP kan de assistent zeggen: "Ik weet het niet."
  • Dit is geen falen; het is een veilige keuze. Het model geeft toe dat het antwoord niet betrouwbaar is binnen het budget. Dit voorkomt dat mensen op gevaarlijke, verkeerde informatie vertrouwen.

3. De Filter (De "Scharnierende Poort")

Voordat de assistent überhaupt begint met denken, filtert hij de gevonden informatie.

  • Stel je voor dat je een poort hebt die alleen de beste, meest betrouwbare documenten doorlaat.
  • MiCP gebruikt een wiskundige methode om te garanderen dat alle belangrijke bewijsstukken (de "gouden documenten") door die poort komen, terwijl de onzin eruit wordt gegooid. Dit zorgt ervoor dat de assistent niet door rommelige informatie wordt afgeleid.

Waarom is dit belangrijk?

Dit onderzoek is als het bouwen van een veiligheidsgordel voor AI.

  • Voor de gebruiker: Je krijgt snellere antwoorden (want de AI stopt niet onnodig lang door) en je weet dat het antwoord betrouwbaar is.
  • Voor de wereld: In gebieden waar fouten dodelijk kunnen zijn (zoals een medische diagnose of een beleggingsadvies), kun je nu vertrouwen hebben dat de AI ofwel het juiste antwoord geeft, of eerlijk toegeeft dat hij het niet weet.

Kort samengevat:
MiCP is een slimme regelaar die de AI leert: "Zoek net lang genoeg om zeker te zijn, maar stop direct zodra je dat zekerheid hebt. En als je het niet weet, zeg het dan gewoon, in plaats van te raden." Dit maakt AI niet alleen slimmer, maar ook veiliger en goedkoper.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →