← Nieuwste papers
🤖 AI

Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning

Dit artikel stelt een nieuw raamwerk voor dat op LLM gebaseerde evolutionaire zoektocht voor algoritmediscovery verbetert door de LLM-zoekoperator voortdurend te verfijnen via versterkingsleer-finetuning, waardoor de identificatie van superieure oplossingen in combinatorische optimalisatietaken wordt versneld.

Oorspronkelijke auteurs: Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een nieuw, super-efficiënt recept te bedenken voor het bakken van de perfecte taart. Je hebt een zeer getalenteerde chef (het Large Language Model, of LLM) die recepten kan opschrijven.

De Oude Manier: De "Statische Chef"
In eerdere methoden (zoals de methode die "FunSearch" heet), zou je de chef vragen een recept te schrijven. Je bakt het, proeft het en kijkt of het goed is. Als het oké is, bewaar je het. Als het geweldig is, vraag je de chef om naar dat geweldige recept te kijken en te proberen er een iets beter versie op te baseren. Je herhaalt dit duizenden keren.

Het probleem? De chef leert eigenlijk nooit echt van het proces. Ze zijn als een genie dat na elke poging alles vergeet. Ze blijven gokken op basis van hun oorspronkelijke training, in de hoop door pure geluk een beter recept te vinden. Ze updaten hun interne kennis van wat een goede taart maakt niet.

De Nieuwe Manier: "EvoTune" (De Chef die Leert)
De auteurs van dit artikel stellen een nieuwe methode voor die EvoTune heet. Het is alsof je diezelfde getalenteerde chef inhuurt, maar deze keer geef je ze een speciaal trainingslus:

  1. De Proef (Evolutionaire Zoektocht): Net als voorheen schrijft de chef veel recepten. Je bakt ze, proeft ze en geeft ze een score. Je houdt de beste vast en gooit de slechte weg.
  2. De Les (Versterkend Leren): Dit is de magische stap. In plaats van alleen de slechte recepten weg te gooien, laat je de chef de "winnaars" en de "verliezers" zien en zeg je: "Kijk naar het verschil! De winnaar deed dit, de verliezer deed dat."
  3. De Update: Je geeft de chef vervolgens een snelle "opfriscursus" (fine-tuning) op basis van deze lessen. Het brein van de chef verandert daadwerkelijk om te begrijpen waarom het winnende recept werkte.
  4. Herhalen: Nu, wanneer je de chef vraagt de volgende batch recepten te schrijven, gokken ze niet meer zomaar. Ze gebruiken hun bijgewerkte kennis om veel sneller de goede plekken aan te sturen.

Waarom is dit beter?
Denk eraan als het zoeken naar een verborgen schat in een gigantisch bos.

  • De Oude Manier: Je stuurt een verkenners die een kaart hebben maar geen geheugen. Ze dwalen rond, vinden een plek, controleren op schat en vergeten vervolgens alles. Ze moeten weer willekeurig dwalen om de volgende plek te vinden.
  • EvoTune: De verkenners vinden een plek, beseffen "Oh, de bomen zijn hier dichter, dus de schat zit waarschijnlijk in de buurt", en updaten hun interne kaart. De volgende keer dat ze eropuit gaan, dwalen ze niet willekeurig; ze lopen rechtstreeks naar de veelbelovende gebieden.

Wat hebben ze getest?
De onderzoekers testten dit op drie moeilijke "puzzel"-spellen waarbij computers de beste manier moeten vinden om dingen te organiseren:

  1. Bin Packing: Proberen dozen van verschillende maten in het kleinste aantal vrachtwagens mogelijk te krijgen.
  2. Traveling Salesman: De kortste route vinden om een lijst steden te bezoeken zonder stappen terug te hoeven zetten.
  3. Flatpack: Vreemd gevormde blokken in een raster passen zonder dat ze overlappen (zoals een complexe Tetris).

De Resultaten
Ze ontdekten dat de "lerende chef" (EvoTune) veel sneller betere oplossingen vond dan de "statische chef" (de oude methode).

  • Betere Scores: De recepten (algoritmen) die door EvoTune werden gevonden, waren efficiënter.
  • Meer Variatie: De lerende chef vond niet alleen één goed recept en stopte toen; ze vonden een bredere verscheidenheid aan unieke, hoogwaardige oplossingen.
  • Wereldwijd Succes: In een specifieke uitdaging (Google's Hash Code-wedstrijd over het plaatsen van servers in een datacenter), vond EvoTune een oplossing die eigenlijk beter was dan de beste oplossing die door menselijke teams in de wedstrijd werd gevonden.

De Geheimzinnige Saus
Het artikel noemt ook een specifieke truc die ze gebruikten om de chef creatief te houden. Soms, wanneer je een model te veel leert, raakt het "vast" en schrijft het steeds maar hetzelfde. Om dit te voorkomen, gebruikten ze een speciale wiskundige regel (genaamd "Forward KL") die de chef dwingt nieuwe ideeën te blijven verkennen terwijl ze nog steeds leren van de winnaars.

In het Kort
EvoTune is een systeem dat zoeken (vele dingen proberen) combineert met leren (het brein van de AI updaten op basis van wat werkte). Het verandert een statisch hulpmiddel in een zelfverbeterende partner die slimmer wordt naarmate het meer probeert een probleem op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →