← Nieuwste papers
💻 computer science

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

Het artikel introduceert EvoLM, een zelftoezichtende post-trainingmethode die taalkundige modellen in staat stelt om iteratief te verbeteren door afwisselend instance-specifieke discriminatieve rubrieken te genereren en het beleid te optimaliseren met behulp van die rubrieken als beloningen, waardoor superieure resultaten worden bereikt zonder afhankelijkheid van externe menselijke of modeltoezicht.

Oorspronkelijke auteurs: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

Gepubliceerd 2026-05-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student (het Policy Model) probeert te leren perfecte essays te schrijven. Op de oude manier zou je een strenge leraar (een mens of een super-intelligente AI) nodig hebben om elk essay te lezen, te beoordelen en de student te vertellen wat ze fout hebben gedaan. Dit is duur, traag en beperkt door hoe slim die leraar is.

EVOLM is een nieuwe methode die de student toelaat om zijn eigen leraar te worden, maar dan met een slimme draai. In plaats van alleen maar te gokken hoe een "goed" essay eruitziet, leert de student voor elk essay dat hij schrijft een specifieke checklist (een Rubric genaamd) te schrijven.

Hier is hoe het proces werkt, opgesplitst in eenvoudige stappen:

1. De Twee Rollen: De Schrijver en de Checklist-Maker

In dit systeem speelt hetzelfde AI-model tegelijkertijd twee rollen:

  • De Schrijver (Policy): Dit deel genereert antwoorden op vragen.
  • De Checklist-Maker (Rubric Generator): Dit deel bekijkt de vraag en schrijft een specifieke set regels (een rubric) op over hoe het antwoord beoordeeld moet worden.

Denk hierbij aan een chef die niet alleen het gerecht bereidt, maar ook na het koken het receptkaartje schrijft, waarin precies wordt uitgelegd waarom het gerecht goed of slecht is.

2. De "Tijdsreizen"-Feedbacklus

Hoe weet het systeem of de checklist goed is? Het heeft geen mens nodig die zegt "Goed gedaan!". In plaats daarvan maakt het gebruik van Tijdsreizen.

  • Stap A: De AI schrijft vandaag een antwoord.
  • Stap B: Het kijkt terug naar een antwoord dat het een paar dagen geleden schreef (een "eerdere versie" van zichzelf).
  • Stap C: Het gaat ervan uit dat het nieuwe antwoord beter is, omdat de AI heeft geleerd.
  • Stap D: De Checklist-Maker maakt een rubric om beide antwoorden te beoordelen.

Het doel is simpel: De rubric moet duidelijk in staat zijn om het verschil te maken tussen het "nieuwe, betere" antwoord en het "oude, slechtere" antwoord. Als de rubric vaag is, zal hij het verschil niet kunnen opmerken. Als de rubric scherp en specifiek is, zal hij het nieuwe antwoord een hoge score geven en het oude antwoord een lage score.

3. De Co-evolutiedans

Hier gebeurt de magie. De twee rollen verbeteren elkaar om beurten in een lus:

  1. De Schrijver wordt beter: Met behulp van de checklists leert de Schrijver betere antwoorden te produceren om hogere scores te krijgen.
  2. De Checklist-Maker wordt scherper: Naarmate de Schrijver beter wordt, zien de oude antwoorden er in vergelijking nog slechter uit. Om het verschil tussen "goed" en "geweldig" te blijven maken, moet de Checklist-Maker specifiekere en gedetailleerdere regels schrijven. Hij kan niet alleen zeggen "Goede grammatica"; hij moet zeggen "De zin moet een komma bevatten na de inleidende zin."

Na verloop van tijd evolueren de checklists van vage labels zoals "Maak het interessant" naar concrete, verifieerbare instructies zoals "Het antwoord moet het getal 144 bevatten, afgeleid van de omtrek van 48."

4. De "Kleine Rechter"-Truc

Normaal gesproken heb je een gigantische, super-slimme AI nodig om complexe essays te beoordelen. Maar EVOLM gebruikt een kleine, ingevroren AI (een kleine rechter) om de daadwerkelijke scoring te doen.

Omdat de Checklist-Maker heeft geleerd om zo specifieke, concrete regels te schrijven (bijvoorbeeld "Controleer of het woord 'innovatie' twee keer voorkomt"), kan zelfs een kleine, simpele AI de instructies perfect volgen. Het is alsof je een klein kind een zeer specifieke schatkaart geeft: het hoeft geen detective te zijn; het hoeft alleen maar de kaart te volgen.

Waarom is dit een groot ding?

  • Geen Externe Leraren Nodig: Het systeem heeft geen mensen nodig om duizenden essays te beoordelen of om te betalen voor dure AI-API's. Het creëert zijn eigen trainingsignaal uit zijn eigen prestaties uit het verleden.
  • Het Doorbreekt het Plafond: Als je afhankelijk bent van een menselijke leraar, kan de AI nooit beter worden dan die mens. Als je afhankelijk bent van een specifieke AI-leraar, zit de AI vast op het niveau van die leraar. Met EVOLM evolueert de "leraar" van de AI (de rubric) met de AI mee, zodat het plafond blijft stijgen.
  • Het Werkt: Het artikel toont aan dat deze zelfopgeleide AI (met behulp van een klein model van 8 miljard parameters) systemen die GPT-4 gebruikten (een veel groter, duurder model) om de regels te genereren, daadwerkelijk overtrof.

In het kort: EVOLM is een zelfverbeterende lus waarbij een AI leert om zijn eigen gedetailleerde beoordelingsrubrics te schrijven. Door voortdurend zijn huidige zelf te vergelijken met zijn vroegere zelf, dwingt hij zichzelf om steeds preciezere regels te schrijven, wat op zijn beurt helpt om betere antwoorden te leren schrijven, allemaal zonder dat een mens hoeft in te grijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →