← Nieuwste papers
🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

Dit artikel introduceert Budget-Efficient Thinking (BET), een tweestapskader dat de compute tijdens het testen van grote redeneringsmodellen optimaliseert door te leren dynamisch budgetten toe te wijzen op basis van verwachte opbrengsten in plaats van waargenomen moeilijkheidsgraad, waardoor aanzienlijke tokenreductie wordt bereikt terwijl de prestaties worden verbeterd via adaptief "short solve"-, "nice fold"- en "hero call"-gedrag.

Oorspronkelijke auteurs: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

Gepubliceerd 2026-05-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, maar iets te enthousiaste assistent hebt die voor jou een enorme stapel puzzels probeert op te lossen. Deze assistent is geweldig in nadenken, maar heeft een slechte gewoonte: soms besteden ze uren aan het staren naar een puzzel die onoplosbaar is, en andere keren analyseren ze een simpele puzzel die in een minuut had kunnen worden opgelost, te diep. Dit kost je tijd en geld (in de vorm van rekenkracht).

Dit artikel introduceert een nieuwe trainingsmethode genaamd BET (Budget-Efficient Thinking) om deze assistent te leren slimmer te zijn over hoeveel "denk-energie" ze aan elke puzzel besteden.

Hier is hoe BET werkt, met behulp van eenvoudige analogieën:

Het Probleem: De "Overdenker" versus de "Onderdenker"

Op dit moment gedragen grote AI-modellen zich als een student die niet weet wanneer hij moet stoppen met studeren.

  • De Eenvoudige Puzzel: Als je vraagt: "Wat is 2+2?", schrijft de student misschien een essay van 10 pagina's om te bewijzen waarom 2+2 gelijk is aan 4, wat tijd kost.
  • De Onoplosbare Puzzel: Als je een vraag stelt die op dit moment te moeilijk is voor de student (zoals een complex wiskundeprobleem dat ze nog niet hebben geleerd), blijven ze misschien urenlang proberen, zonder resultaat, alleen omdat ze niet weten dat ze het niet kunnen oplossen.
  • De Moeilijke Maar Oplosbare Puzzel: Als de puzzel moeilijk maar oplosbaar is, moet de student blijven nadenken. Maar huidige methoden snijden hen soms te vroeg af, waardoor ze een puzzel opgeven die ze hadden kunnen oplossen.

De Oplossing: De Drie Superkrachten van BET

Het artikel leert de AI drie specifieke gedragingen, die de auteurs "Short Solve", "Nice Fold" en "Hero Call" noemen. Denk hierbij aan pokerspellen:

  1. Short Solve (De Snelle Winst):

    • De Analogie: Je ziet een simpele hand in poker. Je weet dat je gaat winnen, dus je hoeft niet te bluffen of te veel te analyseren. Je pakt gewoon de fiches en gaat verder.
    • Wat BET doet: Als de AI een eenvoudige vraag ziet, antwoordt ze snel en beknopt. Ze stopt met het verspillen van energie aan dingen die ze al weet.
  2. Nice Fold (Weten wanneer je moet stoppen):

    • De Analogie: Je speelt poker en je realiseert je dat je hand verschrikkelijk is en de kansen tegen je zijn. Een slimme speler "foldt" (geeft op) direct om zijn geld te sparen voor betere handen. Ze gooien geen geld meer weg in een verliezend spel.
    • Wat BET doet: Als de AI beseft dat een vraag te moeilijk is voor haar huidige denkkracht, zegt ze: "Ik kan dit niet oplossen," en stopt direct. Ze verspillen geen tijd aan het forceren van een antwoord op een probleem dat ze niet kunnen kraken. Dit bespaart een enorme hoeveelheid rekenkracht.
  3. Hero Call (Alles op het juiste moment inzetten):

    • De Analogie: Je hebt een sterke hand in poker, maar het is nog niet duidelijk. Je weet dat je meer geld moet investeren om de grote pot te winnen. Je doet een "hero call" en blijft diep spelen.
    • Wat BET doet: Als de AI een moeilijke vraag ziet die ze wel kan oplossen als ze hard genoeg nadenkt, spaart ze haar energie en gaat ze door. Ze snijdt zichzelf niet te vroeg af.

Hoe Ze de AI Leerden (De Twee-Fase Training)

De onderzoekers vertelden de AI niet zomaar "wees efficiënt". Ze leerden haar in twee stappen:

  • Fase 1: Het Lesplan (Koude Start): Ze toonden de AI voorbeelden van hoe ze zich moet gedragen. Ze toonden haar: "Hier is een eenvoudig probleem; zo beantwoord je het snel." "Hier is een onmogelijk probleem; zo zeg je 'Ik geef op'." "Hier is een moeilijk probleem; zo blijf je nadenken."
  • Fase 2: Het Oefenspel (Versterkend Leren): Ze lieten de AI het spel spelen. Elke keer dat de AI probeerde een probleem op te lossen, controleerde het systeem: "Heb je tijd verspild aan een onmogelijk probleem? Heb je te snel opgegeven bij een moeilijke?" Op basis van de resultaten gaven ze de AI een score (een beloning). Als de AI geld bespaarde op onmogelijke problemen maar toch de moeilijke oploste, kreeg ze een hoge score.

De Resultaten

Toen ze deze nieuwe methode testten op zeven verschillende wiskunde- en logistieke tests:

  • Het bespaarde ongeveer 55% van de denktijd. De AI gebruikte ongeveer de helft van de rekenkracht die ze daarvoor gebruikte.
  • Het werd beter in het oplossen van problemen. Omdat het geen tijd verspilde aan onmogelijke taken of te veel over simpele dingen nadacht, loste het eigenlijk meer moeilijke problemen correct op.
  • Het werkt op nieuwe soorten puzzels. Hoewel ze het alleen hadden getraind op wiskunde, paste het deze "slimme bestedings"-gewoonten toe op wetenschapsvragen en logische puzzels die het nog nooit had gezien.

De Conclusie

BET leert AI-modellen zich te gedragen als een slimme investeerder. In plaats van geld (rekenkracht) blind uit te geven, berekent het de "return on investment" voor elke vraag.

  • Als de return laag is (eenvoudige vraag), geef weinig uit.
  • Als de return negatief is (onmogelijke vraag), geef niets uit.
  • Als de return hoog is (moeilijk maar oplosbaar), investeer zwaar.

Dit maakt AI sneller, goedkoper om te draaien en verrassend beter in het oplossen van de moeilijke dingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →