PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models
Het artikel introduceert PLuRel, een lichtgewicht framework voor het synthetiseren van diverse multi-tabel relationele databases dat voor het eerst aantoont dat het schalen van synthetische data leidt tot voorspelbare prestatieverbeteringen en sterke generalisatie voor Relationele Foundation Modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot probeert te leren hoe hij de chaotische, onderling verbonden wereld van bedrijfsgegevens moet begrijpen. In de echte wereld bewaren bedrijven hun geheimen in enorme "relationele databases" — denk aan gigantische, kamers vol boeken (tabellen) die met elkaar verbonden zijn door specifieke draden (zoals een klant-ID die een naam koppelt aan een bestelgeschiedenis). Om een robot echt slim te maken in het lezen van deze bibliotheken, moeten we hem miljoenen verschillende voorbeelden laten zien. Maar er is een probleem: echte bedrijfsgegevens zijn privé. Ze liggen achter muren van privacywetgeving en bedrijfsgeheimen, dus we kunnen ze niet zomaar aan onze robot overhandigen.
Dit is waar het idee van "synthetische data" om de hoek komt kijken. Het is alsof je een perfecte, nepplant van een bibliothek vanaf nul opbouwt, waarbij je met wiskunde raadt hoe de boeken en de draden eruit zouden moeten zien, zonder ooit een echte te hebben gezien. Wetenschappers hebben dit al gedaan voor enkelvoudige tabellen (zoals een simpele lijst met namen), maar het maken van een neppe, meerkamerige bibliotheek waarbij de verbindingen tussen de kamers logisch zijn, bleek ontzettend moeilijk. Als de robot leert van een neppe bibliotheek waar de verbindingen verbroken of vreemd zijn, zal hij later in de echte wereld geen problemen kunnen oplossen. Dit artikel pakt dat exacte puzzelstukje aan: hoe bouwen we een fabriek die eindeloze, diverse en perfect verbonden neppe databases kan produceren, zodat onze AI de regels van het spel kan leren voordat hij ooit een echte ziet?
De PLUREL-fabriek: Het bouwen van nepwerelden voor AI
Maak kennis met PLUREL, een nieuw framework dat fungeert als zowel een meesterarchitect als een creatieve schrijver. De taak is om synthetische relationele databases vanaf de grond af aan op te bouwen, waarbij "nepwerelden" worden gecreëerd waar AI-modellen op kunnen oefenen. De onderzoekers achter PLUREL wilden zien of ze een geheim wapen voor deze AI-modellen konden ontsluiten: het vermogen om slimmer te worden simpelweg door meer en diversere voorbeelden te zien, een concept dat bekend staat als "scaling laws" (schaalwetten).
Denk bij het trainen van een AI aan het leren rijden aan een tiener. Als je ze alleen laat oefenen op één lege parkeerplaats (een enkele, kleine database), worden ze misschien heel goed in die specifieke parkeerplaats, maar ze zullen crashen zodra ze een drukke stadsstraat (een database uit de echte wereld) raken. PLUREL lost dit op door duizenden verschillende "rijlessen" te genereren — sommige met smalle straten, sommige met rotondes, sommige met zwaar verkeer en sommige met mistig weer. Elke cursus is een unieke database met zijn eigen set tabellen (zoals "Gebruikers", "Items" en "Transacties") en het complexe web van verbindingen tussen hen.
Hoe PLUREL deze nepwerelden bouwt
PLUREL kopieert niet zomaar bestaande data; het bouwt alles vanaf nul in drie creatieve stappen:
- Het Blauwdruk (Schema): Eerst tekent het een kaart van de bibliotheek. Het bepaalt hoeveel kamers (tabellen) er zijn en hoe ze met elkaar verbonden zijn. Het gebruikt een "gerichte graaf" (een chique term voor een kaart met pijlen) om te bepalen welke kamer naar welke andere kamer leidt. Bijvoorbeeld: het kan besluiten dat de "Gebruikers"-kamer verbonden is met de "Bestellingen"-kamer, maar niet direct met de "Verzendingen"-kamer.
- De Draden (Connectiviteit): Vervolgens weeft het de draden die de kamers aan elkaar binden. In een echte database behoort een specifieke bestelling bij een specifieke gebruiker. PLUREL gebruikt een slimme "bipartiete graaf" (een manier om twee groepen aan elkaar te koppelen) om te beslissen welke gebruiker welke bestelling krijgt. Het kiest niet willekeurig; het gebruikt een "hiërarchisch" patroon, zoals een stamboom, om ervoor te zorgen dat de verbindingen natuurlijk aanvoelen. Misschien krijgt een "VIP"-gebruker meer bestellingen, of clusteren bestellingen uit een specifieke regio samen.
- De Inhoud (Kenmerken): Tot slot vult het de kamers met data. Het gebruikt "Structurele Causale Modellen" (denk aan logische motoren) om te beslissen wat er in de cellen komt te staan. Als een gebruiker een winterjas koopt, weet het systeem dat de "datum" in de winter moet liggen en dat de "prijs" misschien hoger is. Het voegt zelfs "temporele patronen" toe, wat betekent dat de data in de loop van de tijd verandert, net als in het echte leven (bijv. verkopen pieken tijdens Black Friday).
De Grote Ontdekking: Meer Variatie = Slimmere AI
Het meest opwindende deel van het paper is wat er gebeurde toen ze een model genaamd de Relational Transformer (RT) trainden op de door PLUREL gegenereerde databases.
De onderzoekers testten twee zaken:
- Grootte: Hoeveel data het model zag? (Totaal aantal tokens, of "woorden" aan data).
- Diversiteit: Hoeveel verschillende neppe databases het model zag? (Het aantal unieke "werelden").
Ze ontdekten een prachtig, voorspelbaar patroon: hoe diverser de trainingsdata, hoe beter het model werd.
Stel je voor dat je een taal leert. Als je 10.000 pagina's van hetzelfde boek leest, zul je dat boek perfect uit je hoofd kennen, maar weet je niet hoe je met een vreemde moet praten. Maar als je 10.000 pagina's leest verspreid over 1.000 verschillende boeken (verschillende genres, verschillende auteurs, verschillende stijlen), dan leer je de regels van de taal. PLUREL toonde aan dat wanneer de AI meer unieke databases zag (toenemende diversiteit), het vermogen om zaken te voorspellen op echte data verbeterde volgens een vloeiende, voorspelbare curve. Dit is een "power law" (machtswet), wat betekent dat de verbetering een constante, wiskundige regel volgt in plaats van willekeurig te zijn.
Werkt het in het echte leven?
De ultieme test was: "Kan deze nep-training helpen bij echte problemen?"
De onderzoekers namen hun AI, die getraind was op miljarden tokens aan de nepdata van PLUREL, en gaven het een korte "bijles" op een kleine hoeveelheid echte data (afkomstig van een benchmark genaamd RelBench). De resultaten waren indrukwekkend:
- De Hybride Aanpak won: Een AI die leerde op de nepdata van PLUREL en daarna werd bijgeschoold op echte data, presteerde aanzienlijk beter dan een AI die alleen van echte data leerde.
- De Winst: Gemiddeld verbeterde deze "Synthetisch + Echt"-aanpak de nauwkeurigheid van het model met 1,2% voor classificatietaken (zoals voorspellen of een gebruiker vertrekt) en met 3,0% voor regressietaken (zoals het voorspellen van een verkoopcijfer).
- De Hoogtepunten: Bij specifieke taken was de verbetering enorm — tot wel 7,4% beter in het voorspellen van gebruikersbetrokkenheid en 5,2% beter in het voorspellen van de klantwaarde op lange termijn (customer lifetime value).
Het paper merkt echter voorzichtig op dat synthetische data op zichzelf geen wondermiddel is. Als ze probeerden om alleen de nepdata te gebruiken zonder ooit echte data te zien, had het model moeite. De nepdata is geweldig om de algemene regels te leren, maar de echte data is nodig om afgestemd te zijn op de specifieke eigenaardigheden van de echte wereld.
Wat dit betekent
PLUREL suggereert dat we niet hoeven te wachten tot bedrijven hun geheime privédata delen om betere AI te bouwen. In plaats daarvan kunnen we onze eigen "trainingsgyms" bouwen met behulp van synthetische data. Door duizenden diverse, wiskundig kloppende neppe databases te genereren, kunnen we AI-modellen de fundamentele regels leren over hoe data met elkaar verbonden is. Dit stelt de modellen in staat om te generaliseren — wat betekent dat ze wat ze in de nepwereld hebben geleerd, succesvol kunnen toepassen in de chaotische, echte wereld.
Het paper concludeert dat dit een veelbelovend nieuw pad is. Het gaat niet alleen om het maken van meer data; het gaat om het maken van betere, meer gevarieerde data. Door het vermogen te ontsluiten om de diversiteit van de trainingsdata op te schalen, helpt PLUREL ons bij het bouwen van Relationele Foundation Models die klaar zijn om de complexe, onderling verbonden datavraagstukken van de toekomst aan te pakken, terwijl de privacy van de echte wereld gewaarborgd blijft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.