← Nieuwste papers
💬 NLP

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

Het artikel stelt Budget-Guided MCTS (BG-MCTS) voor, een tree-search decoding algoritme dat exploratie- en verfijningsstrategieën dynamisch afstemt op het resterende tokenbudget om budget-agnostische baselines te overtreffen in wiskundige en natuurkundige redeneertaken.

Oorspronkelijke auteurs: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die probeert een zeer lastig raadsel op te lossen, maar je hebt een strikte regel: je mag slechts een bepaald aantal vragen stellen voordat de klok afloopt. Dit is precies de uitdaging waar Large Language Models (LLM's) voor staan bij het oplossen van complexe problemen zoals wiskunde of natuurkunde. Ze hebben een "token-budget" — een limiet aan hoeveel woorden of stappen ze kunnen genereren.

De paper introduceert een nieuwe methode genaamd BG-MCTS (Budget-Guided Monte Carlo Tree Search) om deze AI-detectives te helpen problemen beter op te lossen binnen die strikte tijdslimiet.

Zo werkt het, met behulp van eenvoudige analogieën:

Het Probleem: De "One-Size-Fits-All" Detective

Huidige AI-zoekmethoden gedragen zich als een detective met een vast plan, ongeacht hoeveel tijd er nog over is.

  • De Oude Manier: De detective brengt de eerste helft van de dag door met het ondervragen van 100 verschillende mensen voor aanwijzingen (brede exploratie). Dan, in de laatste 10 minuten, realiseert de detective zich dat er geen tijd meer is om daadwerkelijk de meest veelbelovende sporen te volgen. De detective kan vlak voordat de klok op nul staat nog een nieuwe lijn van ondervraging starten, waardoor de zaak onopgelost blijft. Of de detective stopt te vroeg, waardoor de laatste 10 minuten van de dienst verspild worden.
  • Het Probleem: Bestaande methoden behandelen de tijdslimiet (het token-budget) alleen als een "stopbord". Ze veranderen hun strategie niet op basis van hoeveel tijd er nog over is.

De Oplossing: De "Slimme Detective" (BG-MCTS)

De auteurs stellen een detective voor die constant op zijn horloge kijkt en zijn strategie aanpast op basis van de resterende tijd. Ze noemen dit Budget-Guided MCTS.

Beschouw het zoekproces als een boom die groeit vanuit een wortel:

  1. Vroege Fase (Veel tijd over): Wanneer de detective 100% van zijn tijd heeft, handelt hij als een visser die met een breed net vist. Hij werpt een breed net uit en verkent veel ondiepe paden om te zien waar de vissen zich kunnen bevinden. Hij duikt nog niet diep; hij wil alleen de hele oceaan in kaart brengen.
  2. Late Fase (Tijd loopt op): Naarmate de klok tikt (bijvoorbeeld naar 25% van het budget), stopt de detective met het uitwerpen van brede netten. In plaats daarvan kiest hij de twee of drie meest veelbelovende plekken die hij eerder heeft gevonden en duikt hij daar diep in. Hij stopt met het starten van nieuwe lijnen van ondervraging en focust zich volledig op het afronden van het onderzoek van de beste sporen.

Hoe de AI het doet

De paper beschrijft twee specifieuwe trucs die de AI gebruikt om dit te bewerkstelligen:

  • De "Tijd-Check" Score: Wanneer de AI beslist welk pad het volgende gevolgd moet worden, gebruikt het een formule die kijkt naar hoeveel budget er nog over is.
    • Als er veel budget is, moedigt de formule het aan om nieuwe, onverkende paden te proberen.
    • Als het budget laag is, straft de formule het starten van nieuwe paden af en beloont het het dieper gaan in paden die al goed lijken.
  • De "Nieuwe Tak" Schakelaar: De AI heeft een speciale schakelaar die beslist of er een nieuwe tak op de boom gegroeid wordt of dat er alleen dieper in een bestaande tak wordt gedoken.
    • Wanneer er volop tijd is, staat de schakelaar op "Nieuwe Takken Groeien".
    • Wanneer de tijd opraakt, klapt de schakelaar om naar "Dieper Gaan", wat voorkomt dat de AI kostbare laatste seconden verspilt aan het starten van een nieuwe tak die hij niet meer zal kunnen afmaken.

De Resultaten

De onderzoekers hebben deze "Slimme Detective" getest tegenover andere methoden op moeilijke wiskunde- en natuurkundeproblemen. Ze ontdekten dat:

  • Betere Nauwkeurigheid: De AI lost meer problemen correct op binnen dezelfde token-limiet.
  • Geen Verspilde Tijd: In tegen tegenstelling tot andere methoden die misschien te vroeg stoppen of aan het einde te veel nieuwe paden starten, gebruikte BG-MCTS het volledige budget efficiënt. Het verkende breed aan het begin en eindigde sterk aan het eind.
  • Consistente Prestaties: Dit werkte goed voor verschillende soorten AI-modellen en verschillende moeilijkheidsgraden van problemen.

De Kern van het Verhaal

De paper beweert dat door de zoekstrategie van de AI "bewust" te maken van het resterende budget, we veel betere antwoorden kunnen krijgen zonder dat er meer rekenkracht nodig is. Het is also$ als een hardloper leren niet alleen om snel te rennen, maar ook om precies te weten wanneer hij moet sprinten en wanneer hij energie moet sparen, zodat hij de finishlijn met de best mogelijke tijd bereikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →