← Nieuwste papers
🤖 AI

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

Dit artikel introduceert OPT*, een schaalbare familie van optimalisatiestijl-taken met uitbreidende zoekruimtes die het mogelijk maakt om LLM's te trainen en te evalueren op stapsgewijze optimalisatie-achtige redenering door middel van zowel solver-gestuurde online beleidsoptimalisatie als zoekgebaseerd offline reinforcement learning.

Oorspronkelijke auteurs: Nicolás Astorga, Nabeel Seedat, Mihaela van der Schaar

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nicolás Astorga, Nabeel Seedat, Mihaela van der Schaar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente maar licht naïeve robotkok leert hoe hij een complex, meergangenmenu moet bereiden.

Het Probleem: De "Goed Genoeg" Valstrik
Op dit moment zijn deze AI-chefs (Large Language Models) erg goed in het volgen van recepten waarbij er slechts één juist antwoord is, zoals het oplossen van een wiskundige vergelijking of het schrijven van een stuk code dat compileert. Als ze het uiteindelijke antwoord goed hebben, krijgen ze een gouden ster.

Maar het echte leven is niet als dat. Het echte leven lijkt meer op het plannen van een bezorgroute voor 50 vrachtwagens, het toewijzen van 20 werknemers aan 20 verschillende diensten, of het inpakken van een verhuiswagen. In deze scenario's is er niet slechts één juist antwoord, maar zijn er duizenden manieren om het te doen die "geldig" zijn (niets gaat kapot, iedereen heeft een baan), maar slechts een paar manieren die geweldig zijn (kortste afstand, hoogste tevredenheid, minste verspilde ruimte).

Het artikel stelt dat de huidige AI hier moeite mee heeft. De AI kan wel een geldig plan vinden, maar blijft vaak steken op een "goed genoeg" plan en mist het "perfecte" plan omdat het niet weet hoe het vooruit moet kijken of slechte ideeën vroegtijdig moet elimineren.

De Oplossing: OPT⋆ (De Oneindige Speeltuin)
De auteurs hebben een nieuwe trainingsgrond gecreëerd genaamd OPT⋆. Beschouw dit als een levelgenerator voor videogames die de game steeds moeilijker kan maken zonder dat er een menselijke ontwerper nodig is om nieuwe levels te tekenen.

  • Het Spel: Ze gebruiken klassieke optimalisatiepuzzels (zoals het Handelsreizigersprobleem, waarbij je steden bezoekt in de kortste route, of het inpakken van items in een rugzak).
  • Het Spiekbriefje: Het spel heeft twee ingebouwde hulpmiddelen:
    1. De Regelcontroleur: Vertelt je direct of een zet illegaal is (bijv. "Je kunt die zware doos niet bovenop de fragiele doos zetten").
    2. De Scorekeeper: Vertelt je direct hoe goed het uiteindelijke resultaat is (bijv. "Je route heeft 10 minuten bespaard").
  • De Moeilijkheidsgraad-draaiknop: Je kunt een draaiknop (genoemd α\alpha) gebruiken om meer steden, meer werknemers of meer items toe te voegen. Dit zorgt ervoor dat het aantal mogelijke paden exponentieel explodeert, maar de regels en scoring blijven simpel en automatisch. Geen mensen nodig om het huiswerk te nakijken.

Hoe ze de AI hebben geleerd: Twee Methoden

Het artikel test twee manieren om de AI te leren navigeren door deze enorme, uitdijende doolhoven:

1. De "Offline" Methode: De Schatzoektocht
Stel je voor dat de AI in een donkere grot (de zoekruimte) wordt gedropt met een zaklamp. Het heeft geen kaart.

  • De Strategie: De AI dwaalt rond, probeert verschillende paden uit. Wanneer het een pad vindt dat naar een schat leidt (een hoge score), onthoudt de AI dat pad.
  • De Truc: Het artikel introduceert twee "slimme filters" om de zoektocht efficiënt te maken:
    • De Uitsmijter (Haalbaarheidstoets): Als de AI probeert door een muur te lopen (een illegale zet), stopt de Uitsmijter het direct. Het verspilt geen tijd aan het verkennen van zo'n doodlopend pad.
    • De Tweelingdetector (Deduplicatie): Soms zegt de AI "Ga naar het Noorden" in het Engels, "Ga omhoog" in het Frans en "Beweg omhoog" in het Spaans. Dit zijn allemaal dezelfde bewegingen. De Tweelingdetector realiseert zich dat dit dezelfde actie is en houdt slechts één versie over, zodat de AI geen energie verspilt aan hetzelfde idee twee keer.
  • Het Resultaat: De AI leert doodlopende wegen en dubbele ideeën te negeren, waardoor het de schat veel sneller vindt.

2. De "Online" Methode: De Coach met een Kristallen Bol
In dit scenario heeft de AI een coach die de toekomst kan zien (een "solver").

  • De Strategie: De AI maakt een zet. De Coach kijkt naar die zet en berekent direct: "Als je deze stap zet, is het beste wat je vanaf hier kunt bereiken een score van 90."
  • De Beloning: In plaats van te wachten tot het einde van het spel om een score te krijgen, krijgt de AI onmiddellijke feedback bij elke enkele stap. Als een stap leidt tot een lage potentiele score, zegt de Coach: "Slechte zet!" Als het leidt tot een hoge potentie, zegt de Coach: "Goede zet!"
  • Het Resultaat: De AI leert om betere beslissingen te nemen stap voor stap, in plaats van alleen maar te hopen op een goed einde.

Wat ze hebben Ontdekt

  • De "Branching" Bottleneck: Naarmate het spel moeilijker wordt (meer steden/items), groeit het aantal paden zo snel dat een normale zoektocht is als het zoeken naar een naald in een hooiberg ter grootte van een melkwegstelsel. Het artikel bewijst wiskundig dat om succesvol te zijn, de AI beter moet worden in het filteren van slechte paden, en niet alleen harder moet proberen.
  • De Filters Werken: De "Uitsmijter" en "Tweelingdetector" (de offline methoden) maakten de zoektocht aanzienlijk efficiënter. De AI vond kwalitatief hoogwaardige oplossingen veel sneller dan zonder deze filters.
  • De Coach is het Beste (maar duur): De "Online" methode met de Coach (solver) produceerde de slimste AI, maar vereist een krachtige computer om als coach te fungeren. De "Offline" methode is een geweldige back-up wanneer je geen supercomputer bij de hand hebt.
  • Generalisatie: Toen ze de AI trainden op deze optimalisatiepuzzels, werd de AI ook beter in andere ruimtelijke taken (zoals het roteren van vormen of het bedekken van een raster) en verbeterde het zelfs zijn wiskundig redeneren. Het lijkt erop dat de AI een algemene vaardigheid in "hoe te plannen" heeft geleerd, en niet alleen hoe één specifieke puzzel moet oplossen.

In een Notendop
Het artikel introduceert een manier om AI te trainen om beter te worden in complexe planning door games te gebruiken die automatisch steeds moeilijker kunnen worden. Door de AI te leren om snel illegale zetten te herkennen en dubbele ideeën te vermijden, kunnen we helpen dat het de beste oplossingen vindt in enorme, complexe problemen, zelfs zonder een menselijke leraar die toezicht houdt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →