← Nieuwste papers
🤖 AI

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

Hyper-ES is een op subruimtes gebaseerd Evolution Strategy-framework dat het redeneervermogen van LLM's verbetert door de laag-gewijze samenvoegingscoëfficiënten van vooraf berekende gradiëntafdaling-richtingen te optimaliseren, waarmee het een superieure prestatie bereikt met minder middelen vergeleken met gradiëntgebaseerde methoden zoals GRPO-LoRA.

Oorspronkelijke auteurs: Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

Gepubliceerd 2026-08-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren hoe hij ingewikkelde wiskundeproblemen kan oplossen. Meestal moet je een robot leren door hem duizenden voorbeelden te laten zien en zijn hele brein, neuron voor neuron, aan te passen met een proces dat "gradient descent" wordt genoemd. Het is alsof je een enorm orkest probeert af te stemmen door naar elk instrument tegelijk te luisteren en tegelijkertijd elke snaar aan te passen. Het werkt, maar het vereist een gigantische, dure computer en het kost veel tijd.

Onlangs ontdekten wetenschappers een andere manier om robots te leren, genaamd "Evolution Strategies" (ES). In plaats van zorgvuldig elke neuron af te stemmen, maak je simpelweg duizenden kleine, willekeurige veranderingen aan het brein van de robot, kijkt welke veranderingen beter werken bij de wiskundeproblemen, en houdt de winnaars over. Het is als een spelletje "warm of koud" waarbij je het brein van de robot willekeurig door elkaar schudt totdat je geluk hebt. Het probleem is dat wanneer het brein van de robot enorm is (met miljarden onderdelen), willekeurig door elkaar schudden bijna gegarandeerd zal mislukken. Het is alsof je probek een specifieke naald in een hooiberg te vinden door willekeurige handjes hooi te pakken; je eindigt gewoon met meer hooi en geen naald. De paper HYPER-ES probeert dit op te lossen door de robot een betere kaart te geven voordat hij begint met schudden.

Het Probleem: Verdwalen in de Hooiberg

De auteurs van deze paper merkten op dat hoewel Evolution Strategies geweldig zijn voor het besparen van geheugen en rekenkracht, ze verschrikkelijk zijn in het vinden van de juiste richting in een enorm, miljarden-parameters groot brein. Als je simpelweg willekeurige ruis in een gigantisch model gooit, zijn de veranderingen zo chaotisch dat ze elkaar opheffen of het model in de verkeerde richting duwen. Het is alsof je een enorm cruiseschip probeert te sturen door steentjes vanuit willekeurige hoeken tegen het schip te gooien; het schip zal nauwelijks bewegen, of het kan zelfs de verkeerde kant op drijven. De onderzoekers noemen dit het "random walk" probleem, waarbij het model verdwaalt in een zee van nutteloze veranderingen.

De Oplossing: De "Descent Direction" Afkorting

Om dit op te lossen, kwam het team achter HYPER-ES met een slimme tweestaps-truc. In plaats van de robot uit het niets de juiste richting te laten raden, vragen ze hem eerst om een paar zeer korte, goedkope "oefenrondes" te doen met de traditionele, zware methode.

Stel je voor dat je probeert de beste route naar de top van een berg te vinden. In plaats van blind rond te dwalen (willekeurig schudden), stuur je eerst een paar kleine drones uit die een klein stukje klimmen om te zien in welke richting de helling naar beneden loopt. Deze drones hoeven niet de hele berg te beklimmen; ze hoeven alleen maar te ontdekken welke kant "heuvelafwaarts" is (een nuttige richting). De HYPER-ES methode doet precies dit: het voert een paar snelle, goedkope trainingssessies uit om een handvol "descent directions" te vinden – in feeklijk een paar goede gokken over welke richting je het brein van de robot een zetje moet geven om hem slimmer te maken.

De Magische Versmelting: Het Mixen van de Beste Gokkjes

Zodra ze deze paar goede richtingen hebben, vindt de echte magie plaats. In plaats van de Evolution Strategy door het volledige miljarden-parameter brein te laten zoeken, zoeken ze alleen door een kleine, compacte ruimte die bestaat uit het combineren van die paar goede richtingen.

Denk aan een chef die al drie perfecte ingrediënten heeft geïdentificeerd (de descent directions). In plaats van de hele supermarkt af te zoeken naar nieuwe ingrediënten, gebruikt de chef een Evolution Strategy om het perfecte recept te bedenken voor het mengen van die drie ingrediënten. De robot vraagt: "Als ik 30% van richting A, 50% van richting B en 20% van richting C meng, krijg ik dan een betere wiskunde-oplosser?"

De paper gebruikt een geavanceerd algoritme genaamd CMA-ES om dit te mixen. Het is als een meesterkok die de soep proeft en laag voor laag de kruiden aanpast, maar in plaats van kruiden, past hij aan hoeveel van de "goede richting" er aan het brein van de robot wordt toegevoegd. Dit verandert een zoektocht door miljarden mogelijkheden in een zoektocht door slechts een paar honderd getallen, wat het ongelooflijk snel en efficiënt maakt.

Wat Ze Hebben Gevonden

De onderzoekers hebben deze nieuwe methode getest op drie verschillende grote taalmodellen (specifiek Qwen2.5 en DeepSeek-R1) en daagden hen uit met zes verschillende datasets voor wiskundig redeneren, variërend van eenvoudige rekenkunde tot complexe wiskunde op competitieniveau.

De resultaten waren veelbelovend. HYPER-ES presteerde consequent beter dan de standaard "willekeurige schud"-methode en versloeg zelfs licht de traditionele, zware trainingsmethode (genaamd GRPO-LoRA) in termen van nauwkeurigheid. Specifiek behaalde de nieuwe methode gemiddeld ongeveer 1% hogere nauwkeurigheid terwijl deze 10% minder dure computerupdates gebruikte.

In simpelere termen: HYPER-ES slaagde erin om de robots beter te leren in wiskunde door een paar slimme afkortingen te nemen en deze vervolgens zorgvuldig te mengen, in plaats van het met brute kracht op te lossen. Het suggereert dat je niet de hele keuken nodig hebt voor een probleem; soms is het vinden van een paar goede richtingen en het perfect mengen daarvan de sleutel tot het ontsluiten van de redeneervaardigheden van een robot. De paper laat zien dat deze aanpak een stabiele, geheugenefficiënte manier is om het denken van AI te verbeteren, vooral wanneer je niet over een supercomputer beschikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →