← Nieuwste papers
🤖 AI

Steerable Instruction Following Coding Data Synthesis with Actor-Parametric Schema Co-Evolution

Dit artikel introduceert IFCodeEvolve, een actor-schema co-evolutieframework dat Monte Carlo Tree Search en dynamische constraint-instantiatie gebruikt om schaalbare, logisch consistente instructie-gepaarde programmeerdata te synthetiseren, wat leidt tot prestaties van een 32B-model die vergelijkbaar zijn met die van proprietaire state-of-the-art modellen.

Oorspronkelijke auteurs: Tinglin Huang, Bo Chen, Xiao Zhang, Kai Shen, Rex Ying

Gepubliceerd 2026-04-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tinglin Huang, Bo Chen, Xiao Zhang, Kai Shen, Rex Ying

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar nog wat onervaren programmeer-assistent hebt. Je wilt dat hij niet alleen code schrijft die werkt, maar ook precies doet wat jij zegt: "Gebruik geen tijdelijke variabelen," "Gebruik alleen recursie," of "Gebruik slang-achtige namen voor je variabelen."

Het probleem is dat het vinden van genoeg oefenopdrachten die aan al deze specifieke eisen voldoen, en die bovendien logisch haalbaar zijn, erg moeilijk is. Als je de assistent te veel vragen stelt die tegenstrijdig zijn, raakt hij in de war. Als je de vragen te makkelijk maakt, leert hij niets.

De auteurs van dit paper (IFCodeEvolve) hebben een slimme oplossing bedacht om deze assistent te trainen. Ze noemen hun systeem IFCodeEvolve. Hier is hoe het werkt, vertaald naar alledaagse taal met een paar creatieve vergelijkingen:

1. De "Bouwplaat" in plaats van een "Vaste Vraag"

Stel je voor dat je in plaats van één vaste vraag ("Schrijf een Fibonacci-functie"), een bouwplaat (een schema) hebt.

  • De oude manier: Je vraagt de computer om een vraag te bedenken. Vaak zijn die vragen willekeurig of onlogisch.
  • De nieuwe manier (Parametrische Schema's): Ze hebben een bibliotheek met bouwstenen. Bijvoorbeeld: "Gebruik een [loop] van het type [while] of [for]" of "Gebruik [variabelen] met [slang-achtige] namen."
  • Het voordeel: De computer kan deze bouwstenen als Lego-blokjes combineren. Ze hoeven niet elke vraag van nul af aan te schrijven; ze bouwen ze dynamisch op uit deze blokken.

2. De "Monte Carlo Tree Search" (De Slimme Ontdekkingsreiziger)

Nu hebben ze een enorme bibliotheek met mogelijke bouwstenen. Hoe kiezen ze welke combinatie het beste is?
Ze gebruiken een methode die lijkt op het spelen van een strategisch spel (zoals Go of Schaken), genaamd Monte Carlo Tree Search (MCTS).

  • De Analogie: Stel je voor dat je een labyrint doorloopt. Je probeert niet elke weg, maar je kijkt naar welke paden al eens hebben geleid naar een interessante uitdaging.
  • Hoe het werkt: Het systeem probeert een combinatie van instructies. Als de assistent (de "Actor") erin slaagt om de code te schrijven, is de opdracht te makkelijk. Als de assistent faalt, is het misschien te moeilijk of onlogisch. Het systeem "leert" van deze pogingen en zoekt steeds naar de "gouden middenweg": een opdracht die net moeilijk genoeg is om te leren, maar niet onmogelijk.

3. De "Acteur" en de "Regisseur" die samen groeien (Co-evolutie)

Dit is het meest unieke deel van hun idee. Ze laten twee dingen tegelijk groeien:

  1. De Acteur (De Assistent): Dit is het AI-model dat de code schrijft.
  2. De Regisseur (De Bibliotheek met Instructies): Dit is het systeem dat de opdrachten bedenkt.

Hoe het werkt:

  • Ronde 1: De Regisseur geeft de Acteur een opdracht. De Acteur probeert het.
  • Feedback: Als de Acteur het lukt, zegt de Regisseur: "Oké, dat was te makkelijk. Laten we de volgende keer een extra moeilijkheidsgraad toevoegen."
  • Training: De Acteur traint op deze nieuwe, moeilijkere opdracht en wordt slimmer.
  • Evolutie van de Regisseur: Omdat de Acteur nu slimmer is, moet de Regisseur ook slimmer worden. Hij kijkt naar welke instructies de Acteur niet meer kan oplossen.
    • Combinatie: Hij plakt twee moeilijke instructies aan elkaar (bijv. "Gebruik recursie" + "Gebruik geen tijdelijke variabelen").
    • Mutatie: Hij maakt een instructie strenger (bijv. "Gebruik slang-namen" wordt "Gebruik slang-namen én elk woord moet een cijfer bevatten").

Het is alsof je een speler (de Acteur) en een trainer (de Regisseur) hebt. De trainer ziet dat de speler beter wordt, en past de trainingssessies direct aan om de speler uit te dagen, zonder dat de trainer zelf de regels verandert. Ze groeien samen.

4. De "Bewijslast" (Proof-by-Construction)

Een groot probleem bij het genereren van code is dat AI soms dingen bedenkt die klinken als code, maar niet werken.
In dit systeem wordt elke opdracht direct getest.

  • De Analogie: Stel je voor dat je een brug ontwerpt. Je mag de brug niet pas testen als hij af is. Je moet tijdens het ontwerpen al controleren: "Als ik deze steen hier leg, staat de brug dan nog?"
  • In het systeem: Zodra een instructie wordt toegevoegd, probeert het systeem direct een stukje code te schrijven dat aan alle eisen voldoet. Als dat niet lukt, wordt de opdracht verworpen. Dit zorgt ervoor dat alle gegenereerde oefeningen logisch haalbaar zijn.

Het Resultaat

Door deze methode te gebruiken, hebben ze een enorme hoeveelheid hoogwaardige oefenopdrachten gegenereerd.

  • Ze hebben een nieuwe testbank gemaakt genaamd IFCodeBench, waar mensen handmatig hebben gekeken of de vragen goed zijn.
  • Ze hebben getoond dat hun methode werkt: een model van 32 miljard parameters (groot, maar niet het allerduurste) kon na deze training net zo goed presteren als de allerbeste, dure, gesloten modellen van bedrijven zoals OpenAI of Google.

Kortom:
Ze hebben een systeem bedacht dat zichzelf een "trainingsprogramma" voor programmeer-AI's bouwt. Het systeem bedenkt steeds moeilijkere en betere oefeningen, test of ze haalbaar zijn, en past de moeilijkheidsgraad aan naarmate de AI slimmer wordt. Het is een zelfverbeterende cyclus die zorgt voor een perfect afgestemde leeromgeving.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →