← Nieuwste papers
💻 computer science

Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits

Dit artikel analyseert de empirische regulariteiten van door LLM's geleide evolutionaire zoektochten om BaSE voor te stellen, een multi-armed bandit-algoritme dat compute dynamisch toewijst over parallelle trajecten, wat resulteert in een verbetering van 12,3% in gemiddelde fitheid en verhoogde betrouwbaarheid ten opzichte van traditionele diepte-breedte-strategieën zonder de onderliggende modellen of prompts aan te passen.

Oorspronkelijke auteurs: Sixue Xing, Haoyu He, Kerui Wu, Zhuo Yang, Haozheng Luo, Tianfan Fu, Aarthy Nagarajan

Gepubliceerd 2026-05-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sixue Xing, Haoyu He, Kerui Wu, Zhuo Yang, Haozheng Luo, Tianfan Fu, Aarthy Nagarajan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer moeilijk raadsel op te lossen, zoals het perfect passen van 26 cirkels in een vierkant of het rangschikken van punten om de afstand tussen hen te maximaliseren. Je hebt een super-slimme assistent (een Large Language Model, of LLM) die nieuwe manieren kan voorstellen om de stukken te rangschikken. Je hebt echter slechts een beperkte hoeveelheid "energie" of "budget" om de assistent om suggesties te vragen.

Dit artikel gaat over het uitvinden van de beste manier om die energie te besteden om de best mogelijke oplossing voor het raadsel te krijgen.

Het Probleem: Hoe geef je je "vraag-budget" uit?

In het verleden probeerden onderzoekers twee hoofdmanieren om hun beperkte budget aan vragen aan de AI te gebruiken:

  1. De "Diepe Duik" (Diepte): Vraag de AI om één enkel idee te nemen, het te verbeteren, om een betere versie daarvan te vragen, en die ene weg langdurig te blijven volgen. Het is als één zeer diep gat graven.
  2. Het "Brede Net" (Breedte): Vraag de AI om 100 verschillende willekeurige ideeën tegelijk te genereren, de beste te kiezen en te stoppen. Het is als een breed net werpen, maar er slechts één vis uit te halen.

De meeste eerdere studies rapporteerden alleen het beste resultaat dat ze ooit kregen, vaak na het proberen van honderden verschillende combinaties. Ze vertelden ons niet hoe betrouwbaar die resultaten waren of hoe je ze consistent kon bereiken met een vast budget.

De Ontdekking: Het Hangt Af van het Raadsel

De auteurs voerden duizenden experimenten uit met verschillende AI-modellen en drie verschillende soorten raadsels. Ze vonden twee grote regels:

  1. Het "Vermogensplafond": Als de AI niet slim genoeg is voor het specifieke raadsel, maakt het niet uit hoe je je budget besteedt; het raadsel wordt niet opgelost. Maar als de AI wel slim genoeg is, verdwijnt het verschil tussen een kleine AI en een enorme AI vaak wanneer je de werkelijke "rekenwerk" meet.
  2. De "Vorm van de Oplossing":
    • Raadsel A (Cirkelpacking): Dit raadsel is als een breed, vlak plateau. Je kunt diep of breed gaan, en je zult waarschijnlijk een goede oplossing vinden. Het is vergevingsgezind.
    • Raadsel B (MinMax Afstanden): Dit raadsel is als een scherpe bergkam. Je moet de exacte juiste balans vinden tussen diep graven en een breed net werpen. Als je te diep of te breed gaat, mis je de top.

De Oplossing: BaSE (De Slimme Verkeersregelaar)

De auteurs realiseerden zich dat het simpelweg kiezen tussen "Diep" of "Breed" niet genoeg is, omdat de AI onvoorspelbaar is. Soms blijft een enkele run vastzitten in een slecht idee, en soms vindt het een goudmijn.

Ze creëerden een nieuwe methode genaamd BaSE (Bandit-based Self-Evolving).

De Analogie: De Strategie van de Eénarmige Bandiet
Stel je voor dat je in een casino bent met 10 verschillende speelautomaten (dit zijn 10 verschillende AI-"runs" die proberen het raadsel op te lossen). Je hebt een vast aantal munten (je budget).

  • Oude Manier: Je kiest één machine en blijft aan de hendel trekken totdat je je munten op hebt. Als die machine een "verliezer" is, verlies je alles.
  • BaSE Manier: Je trekt één keer aan de hendel van alle 10 machines. Dan kijk je welke het meest uitbetalen. Je stopt met munten geven aan de verliezende machines en giet al je resterende munten in de winnende machines.

BaSE fungeert als een slimme verkeersregelaar. Het verandert niet het brein van de AI of de regels van het raadsel. Het monitort gewoon voortdurend welke "paden" werken en verplaatst het budget naar de winnaars terwijl het de verliezers verlaat.

De Resultaten

  • Betere Consistentie: Door BaSE te gebruiken, verbeterde de gemiddelde score van de oplossingen met 12,3% in vergelijking met de beste bestaande methoden.
  • Betrouwbaarheid: Het maakte de resultaten veel betrouwbaarder. In plaats van een gelukkige "jackpot" één keer in de honderd pogingen te krijgen, krijg je consequent een hoge score.
  • Geen Magische Trucs: Ze gebruikten geen slimmer AI-model of een betere prompt. Ze gaven gewoon hetzelfde bedrag op een slimmere manier uit.

De Conclusie

Als je een beperkt budget hebt om een AI een moeilijk probleem te laten oplossen, blijf dan niet vastzitten op één pad of gooi niet alles in één keer. Gebruik een strategie die meerdere pogingen tegelijk bewaakt en je middelen snel verplaatst naar diegene die daadwerkelijk werken. Dit artikel bewijst dat hoe je je rekenkracht toewijst, net zo belangrijk is als het AI-model dat je gebruikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →