← Nieuwste papers
💻 computer science

Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs

Dit artikel introduceert UCD-Training, een tweestaps trainingsframework dat gebruikmaakt van code-graaftechnieken om reasoning-georiënteerde synthetische data te genereren voor onbekende codebases, waardoor de hallucinaties en het begrip van Large Language Models voor nieuwe softwareframeworks worden verbeterd.

Oorspronkelijke auteurs: Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

Gepubliceerd 2026-02-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe, complexe machine krijgt om te bedienen, maar je hebt geen handleiding, geen instructievideo en de machine is nog nooit eerder door iemand gebruikt. Je probeert hem te besturen op basis van wat je van andere machines hebt geleerd, maar je maakt veel fouten, bedacht functies die niet bestaan, en de machine werkt niet zoals hij zou moeten.

Dit is precies het probleem dat UCD-Training oplost voor kunstmatige intelligentie (AI) als het gaat om nieuwe software.

Hier is een uitleg in gewone taal, met een paar creatieve vergelijkingen:

Het Probleem: De "Nieuwe Machine"

Grote taalmodellen (zoals de slimme AI's die we vandaag kennen) zijn getraind op een enorme hoeveelheid oude, publieke code (zoals GitHub). Ze zijn experts in wat ze al kennen. Maar als een bedrijf een nieuwe, interne software lanceert (een "onzichtbare codebase"), is de AI volledig in de war.

  • Huidige oplossing (RAG): Dit is alsof je een zoekmachine gebruikt terwijl je de machine probeert te bedienen. Je zoekt even op "hoe werkt knop A?" en plakt het antwoord in je prompt. Dit helpt een beetje, maar de AI begrijpt niet waarom knop A samenwerkt met knop B. Het is oppervlakkig.
  • Het echte probleem: De AI mist de "geest" van de machine. Het weet niet hoe de onderdelen met elkaar verbonden zijn of hoe ze samenwerken in de echte wereld.

De Oplossing: UCD-Training

De auteurs van dit papier hebben een slimme methode bedacht om de AI echt te laten leren over deze nieuwe machines, zonder dat er al een handleiding bestaat. Ze noemen het UCD-Training.

Het werkt in twee stappen, alsof je een leerling eerst de blauwdrukken laat zien en hem daarna laat oefenen met een simulator.

Stap 1: De "Stadsplattegrond" (Code Graph)

In plaats van alleen naar de code te kijken als een lange tekst, bouwen ze eerst een stadsplattegrond (een grafiek) van de software.

  • Ze kijken naar elke functie, elke variabele en elk bestand.
  • Ze tekenen lijntjes tussen de dingen die met elkaar praten (bijv. "Bestand A roept Functie B aan").
  • Vergelijking: Het is alsof je van een heel stadje niet alleen de straten ziet, maar ook een kaart maakt van welke huizen welke buren hebben en welke wegen er naartoe leiden. Zo begrijp je de structuur van de stad, niet alleen de huizen op zich.

Stap 2: Twee soorten training

Nu gebruiken ze die plattegrond om de AI te trainen op twee manieren:

  1. De "Lees-als-je-oudste" methode (CPT):
    De AI leest de code in de juiste volgorde, precies zoals de plattegrond aangeeft. Als bestand A nodig is voor bestand B, leest de AI eerst A en dan B.

    • Vergelijking: Het is alsof je een detectiveverhaal leest in de juiste volgorde, zodat je de plot begrijpt, in plaats van willekeurige bladzijden te lezen. De AI leert zo hoe de stukken van de puzzel in elkaar passen.
  2. De "Simulator" methode (SFT):
    Dit is het meest creatieve deel. De AI moet nu oefenen met drie soorten taken, allemaal gebaseerd op de plattegrond:

    • Relaties: "Welke knop zit naast welke?" (Eenvoudige vragen).
    • Combinaties: "Hoe gebruik ik deze drie knoppen samen om een taak te doen?" (Complexere vragen).
    • Gebruik: "Hoe zou een echte gebruiker dit systeem inzetten?" (De moeilijkste vragen).
    • De truc: De AI krijgt niet alleen het antwoord, maar ook een gedachtegang (een "redenatie"). De AI ziet hoe een mens zou nadenken om het probleem op te lossen.
    • Vergelijking: Het is alsof je een leerling niet alleen de oplossing van een wiskundeprobleem geeft, maar ook de stap-voor-stap uitleg van de leraar: "Eerst doen we dit, omdat dat nodig is voor dat..."

Waarom is dit zo goed?

De resultaten zijn indrukwekkend.

  • Beter dan zoeken: De AI die getraind is met deze methode werkt veel beter dan AI's die alleen zoeken (RAG). Ze begrijpen de diepere logica.
  • Minder hallucinaties: De AI verzint minder dingen die niet bestaan.
  • Schaalbaar: Het werkt goed, of je nu een kleine of een hele grote AI gebruikt, en of het nu Python of C++ is.
  • Echte wereld: Zelfs als je de AI moet laten werken met meerdere nieuwe systemen tegelijk (zoals in een groot bedrijf), blijft het goed werken.

Samenvatting in één zin

UCD-Training is als het bouwen van een interactieve simulator en handleiding voor een nieuwe machine, puur op basis van de blauwdrukken, zodat de AI niet alleen de knoppen kent, maar ook begrijpt hoe het hele systeem werkt en samenwerkt.

Dit maakt AI veel nuttiger voor bedrijven die met hun eigen, unieke software werken, waar de AI voorheen geen raad mee wist.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →