← Nieuwste papers
💻 computer science

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

Het artikel introduceert DIVE, een op diversiteit gestuurd framework dat bevroren grote taalmodellen in staat stelt om via het evolueren en selecteren van complementaire natuurlijke taalvaardigheden uit taakervaring en verifier-feedback snelle, parameter-vrije zelfverbetering te bereiken, waardoor het bestaande redeneer- en optimalisatiemethoden overtreft en effectief over model-schalen heen transfeert.

Oorspronkelijke auteurs: Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

Gepubliceerd 2026-08-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotvriend hebt die bijna alles over de wereld weet. Je kunt hem een lastig wiskundeprobleem of een logische puzzel voorleggen, en meestal krijgt hij het goed. Maar hier is de crux: zodra je de robot uitzet en weer aanzet, vergeet hij alles wat hij heeft geleerd van jouw specifieke vragen. Het is alsoals een genie dat elke ochtend met een schone lei wakker wordt, niet in staat om de fouten die hij gisteren maakte of de slimme trucjes die hij ontdekte te herinneren. Normaal gesproken moet je om een robot slimmer te maken zijn brein herbedraden (een proces dat "training" wordt genoemd), wat duur, traag is en speciale toegang vereist die veel mensen niet hebben.

Dus hebben wetenschappers een grote vraag gesteld: Kan een bevroren robot leren zonder zijn brein te herbedraden? Het antwoord ligt in iets dat "prompting" wordt genoemd. In plaats van het brein van de robot te veranderen, verander je de instructies die je aan hem geeft. Denk aan het geven van een nieuw recept aan een chefkok. Als op de kaart staat: "Vergeet niet de soep te zouten," dan kan de chef een beter werk leveren. Maar als de chef steeds dezelfde fout maakt, is een simpel briefje misschien niet genoeg. Je hebt een manier nodig waarop de chef kan opschrijven waarom hij faalde, een betere strategie kan bedenken en die strategie kan omzetten in een permanente regel op zijn receptenkaart, allemaal zonder zijn werkelijke kookvaardigheden te veranderen. Dit is de grens van "zelfverbetering" voor AI: een statisch model leren slimmer te worden door alleen met zichzelf te praten en te leren van zijn eigen ervaringen.

Maak kennis met DIVE (Diversity-Driven Skill Evolution), een nieuwe methode die werkt als een briljant, chaotisch atelier voor deze bevroren robots. De onderzoekers ontdekten dat het, in plaats van te proberen de enkele "perfecte" set instructies te vinden, beter is om een heel team van verschillende "versies" van de robot te laten draaien, die elk op een iets andere manier proberen te leren.

Zo werkt DIVE: stel je een groep van tien verschillende detectives voor die een mysterie proberen op te lossen. In het verleden zouden onderzoekers misschien slechts één detective gevraagd hebben de zaak op te lossen, een fout te maken, en vervolgens te proberen zijn aantekeningen te herstellen. Maar DIVE zegt: "Laten we tien detectives tegelijkertijd aan de zaak werken laten!" Elke detective begint met een iets andere set aantekeningen (een "seed skill"). Terwijl ze werken, krijgen ze feedback over waar ze de fout in gingen.

In plaats van slechts één detective die probeert zijn aantekeningen te herstellen, gebruikt DIVE een gereedschapskist met verschillende "herstelstrategieën". De ene detective probeert misschien Reflective Repair, wat is als kijken naar een fout en zeggen: "O, ik heb hier een aanwijzing gemist, laat me een notitie over dat toevoegen." Een andere probeert Exploratory Revision, wat is als de oude kaart weggooien en een compleet nieuwe tekenen omdat het oude pad een doodlopende weg is. Een derde probeert Compression, wat is als het nemen van een slordig, 50-pagina tellend schrift en dit inkorten tot een bondig referentieblad van 5 pagina's dat alleen de belangrijkste regels behoudt.

De magie van DIVE is dat het niet alleen de "beste" detective kiest en dan stopt. Het houdt alle tien de detectives parallel aan het werk. Het houdt in de gaten welke detective beter wordt in welk soort probleem en geeft hen meer tijd om te werken. Als een detective vastloopt, kan het systeem een nieuwe, frisse strategie inzetten om te helpen. Dit voorkomt dat de hele groep vastloopt op hetzelfde foute idee (een probleem dat "overfitting" wordt genoemd).

Zodra de detectives hun kans hebben gehad om te leren en te evolueren, kiest DIVE niet zomaar de een met de hoogste score. In plaats daarvan kijkt het naar het hele team en kiest het een complementair squad. Misschien is Detective A geweldig in het herkennen van getallenpatronen, terwijl Detective B uitblinkt in het spotten van logische vallen. Door de unieke, geëvolueerde "vaardigheidskaarten" van hen samen te voegen tot één toolkit, kan de robot problemen oplossen die hij voorheen niet kon oplossen.

Het artikel laat zien dat deze methode ongelooflijk goed werkt. Wanneer het werd getest op moeilijke wiskundecompetities (zoals HMMT) en lastige logische puzzels (zoals Sudoku), stelde DIVE kleine, bevroren modellen in staat om razendsnel te leren en te verbeteren. Sterker nog, een klein model dat DIVE's geëvolueerde vaardigheden gebruikte, was in staat om een veel groter, krachtiger model te overtreffen dat alleen standaard instructies gebruikte. De onderzoekers ontdekten dat DIVE deze grote verbeteringen kon bereiken met veel minder pogingen (of "rollouts") dan andere methoden die proberen het brein van het model te veranderen of de prompt slechts één keer aan te passen.

Cruciaal is dat het artikel betoogt dat deze aanpak beter is dan het zoeken naar één enkele "magische prompt" of het vertrouwen op een enkel leertraject. Door een diverse groep evoluerende vaardigheden en de beste delen van elk te bewaren en te mengen, creëert DIVE een robuust, zelfverbeterend systeem dat geen herbedrading nodig heeft. Het suggereert dat voor bevroren modellen het geheim om slimmer te worden niet een enkele perfecte instructie is, maar een diverse, evoluerende bibliotheek van strategieën waar het model uit kan putten om elk probleem op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →