ELMER: Evolutionary Language Model that Explores and Refines
Het artikel introduceert ELMER, een evolutionair taalmodel dat een gefinetunede Qwen3-8B met Direct Preference Optimization gebruikt om natuurlijke taalbeleidmutaties naar kracht te sturen, waarbij wordt aangetoond dat op taal gebaseerde representaties een superieure gedragscalibratie en zoekefficiëntie bieden vergeleken met traditionele syntactische bewerkingsmetrieken in programmaevolutie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren een videogame te spelen, maar in plaats van een joystick te geven, moet je elke keer dat hij een fout maakt een nieuwe set regels voor hem schrijven. Dit is de wereld van programma-evolutie, een vakgebied waar wetenschappers computers gebruiken om betere software te "kweken" door kleine veranderingen aan te brengen, ze te testen en de winnaars te behouden. Lange tijd was dit proces een beetje als pijltjes gooien in het donker. Wetenschappers konden wel zien of een nieuwe versie van de code beter of slechter was, maar ze hadden geen manier om te controleren hoeveel het veranderde. Een kleine aanpassing aan één enkel woord in de code kon een zachtjes wandelende robot per ongeluk veranderen in een chaotische, crashende puinhoop, terwijl een enorme herschrijving de robot precies hetzelfde kon laten doen. De grote vraag die onderzoekers zich hebben gesteld is: Kunnen we een systeem bous dat niet alleen begrijpt wat er veranderd moet worden, maar ook hoe ver het gedrag van de robot moet bewegen, zodat we het nauwkeurig naar een doel kunnen sturen?
Dit is waar het artikel "ELMER: Evolutionary Language Model that Explores and Refines" om draait. De onderzoekers, Matthew Siper, Ahmed Khalifa en Julian Togelius, hebben een slim nieuw systeem gebouwd dat een groot taalmodel (een superintelligente AI die menselijke taal begrijpt) gebruikt om als een "mutatie-operator" te fungeren. In plaats van blindelings computercode te bewerken, bewerkt de AI een beschrijving in natuurlijke taal van een handelsstrategie—zoals een recept voor het kopen en verkopen van aandelen. De AI is getraind om drie specifieke taken te begrijpen: het vertalen van een recept naar code, het vertalen van code terug naar een recept, en het belangrijkste: het muteren van het recept op basis van een "sterkte"-commando. Als je de AI vraagt om een verandering met een "lage sterkte" uit te voeren, past de AI het recept licht aan. Als je zegt "hoge sterkte", herschrijft hij het hele ding.
Het team heeft dit getest op financiële handel, waarbij ze historische marktgegevens gebruikten om te zien hoe goed de nieuwe strategieën presteerden. Ze ontdekten dat door de AI te trainen om aandacht te besteden aan hoeveel de werkelijke acties van de robot veranderden (de "gedragsverplaatsing"), ze de "sterkte"-commando's werkend konden krijgen. Wanneer ze vroegen om een kleine verandering, maakte de AI meestal een kleine verandering; wanneer ze vroegen om een grote verandering, maakte hij een grote verandering. Dit is een grote zaak, omdat het het chaotische proces van programma-evolutie verandert in iets dat meer lijkt op het besturen van een auto. Het artikel laat zien dat het gebruik van beschrijvingen in natuurlijke taal de AI helpt om slimmere, meer gecontroleerde zetten te doen dan wanneer de ruwe code direct wordt bewerkt. In hun tests vond het op taal gebaseerde systeem de best presterende handelsstrategie van alle methoden die ze probeerden, en deed dit efficiënter door met minder pogingen goede resultaten te bereiken. Hoewel het systeem niet perfect is en nog steeds enige willekeur kent, suggereren de resultaten dat het de AI te leren dat het over zijn veranderingen in menselijke taal kan "spreken", ons een veel betere manier geeft om het door de enorme ruimte van mogelijke computerprogramma's te leiden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.