The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows
Het artikel introduceert ReASearch, een verenigd framework waarin een enkele redeneergestuurde agent autonoom het gehele optimalisatieproces voor prompts, programma's en ML-workflows beheert, waardoor complexe zoekbeleid effectief wordt geïnternaliseerd en gespecialiseerde systemen over diverse taken heen wordt overtroffen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren een puzzel op te lossen, een gedicht te schrijven of een personage in een videogame te trainen om te winnen. In de wereld van kunstmatige intelligentie wordt dit "optimalisatie" genoemd. Meestal treden mensen op als de strenge coaches aan de zijlijn. Zij ontwerpen een rigide strijdplan: "Probeer dit, probeer dan dat, en als het mislukt, ga dan terug en probeer iets anders." De robot (een groot taalmodel) is slechts de speler die blindelings bevelen opvolgt om kleine wijzigingen aan te brengen, terwijl de menselijke coach de grote strategie bepaalt. Maar wat als de robot ook de coach zou kunnen zijn? Wat als de robot naar de scorebord kan kijken, kan begrijpen waarom hij heeft verloren, kan besluiten de regels van het spel te veranderen, of zelfs kan beseffen dat hij vastloopt en een compleet nieuwe aanpak nodig heeft—alleen op eigen kracht? Dit artikel onderzoekt precies die vraag: Kan een enkele, slimme AI-agent leren om zijn eigen zoektocht naar de beste oplossing te beheren, zonder een door een mens geschreven script dat hem vertelt hoe hij moet denken?
De onderzoekers achter deze studie, gepubliceerd op de COLM 2026 conferentie, introduceren een nieuw systeem genaamd ReASearch. Zie het als het overhandigen van een Zwitsers zakmes aan de robot in plaats van alleen een hamer. In het verleden waren AI-optimizers als een fabrieksassemblagelijn met een vaste lopende band: een door mensen ontworpen algoritme bepaalde welke kandidaat-oplossing als volgende getest moest worden, hoeveel tijd eraan besteed moest worden en wanneer er opgegeven moest worden. De enige taak van de AI was om een kleine aanpassing aan de huidige oplossing te fluisteren. ReASearch draait het scenario om. Het geeft de AI-agent een set gereedschappen—zoals een Python-interpreter om code uit te voeren, een geheugendocument om eerdere fouten te onthouden, en de mogelijkheid om experimenten uit te voeren—en laat de agent vervolgens alles zelf beslissen. De agent vraagt zichzelf af: "Moet ik dit idee eerst op een kleine steekproef testen? Heb ik zojuist twee keer dezelfde fout gemaakt? Moet ik mijn huidige plan weggooien en teruggaan naar een beter plan dat ik eerder heb geprobeerd?" De agent raadt niet alleen maar; de agent redeneert door het proces en bouwt gaandeweg een strategie op.
Het team testte deze "zelf-coachende" agent op 14 verschillende uitdagingen, variërend van het verfijnen van tekstprompts om ze slimmer te maken, tot het evolueren van computerprogramma's om wiskundige puzzels op te lossen, en zelfs het optimaliseren van workflows voor het trainen van machine learning. De resultaten waren verrassend sterk. In veel gevallen versloeg ReASearch gespecialiseerde systemen die door menselijke experts waren gebouwd met specifieke, hard-gecodeerde regels. Bijvoorbeeld, in een taak genaamd "Circle Packing" (het zo strak mogelijk in een vierkant passen van cirkels), ontdekte de agent oplossingen die beter waren dan de best bekende resultaten die mensen tot nu toe hadden gevonden. In andere taken verbeterde de prestatie met ergens tussen de 2% en een enorme 40%.
Wat echt fascinerend is, is hoe de agent het deed. De onderzoekers ontdekten dat de agent van nature begon te handelen als een ervaren wetenschapper of een grootmeester bij schaken, ook al was dat niet gezegd. De agent begon veelbelovende ideeën te "dubbelchecken" voordat hij zich er volledig op committeerde. De agent leerde om terug te keren naar eerdere, veiligere versies van een oplossing wanneer een nieuw pad in een doodlopende weg uitliep. De agent begon een "lessen geleerd"-dagboek bij te houden om te voorkomen dat dezelfde fouten werden herhaald. Het meest indrukwekkend was dat de agent ontdekte dat je soms twee verschillende technieken moet combineren om een probleem op te lossen, een ontdekking die normaal gesproken diep menselijk inzicht vereist. Het artikel suggereert dat wanneer je een AI de juiste instrumenten geeft en het laat redeneren door het proces, de AI complexe zoekstrategieën kan internaliseren die we voorheen dachten dat een door mensen ontworpen algoritme nodig hadden om te beheren. Het blijkt dat de optimizer niet een aparte, rigide controller hoeft te zijn; de optimizer kan de agent zelf zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.