← Nieuwste papers
🤖 machine learning

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

Dit artikel introduceert RelBench v2, een aanzienlijk uitgebreide benchmark en repository voor relationeel diep leren die vier nieuwe grootschalige datasets, nieuwe autocomplete-taken en integraties met externe frameworks omvat om systematische evaluatie te faciliteren en de superieure prestaties van relationele modellen ten opzichte van single-table-baselines aan te tonen.

Oorspronkelijke auteurs: Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek met informatie hebt. In de oude tijden, als je een patroon wilde vinden, moest je elk boek apart nemen, de pagina's eruit rukken en ze allemaal op één groot, rommelig vel papier plakken. Je verloor de context van welk boek de pagina vandaan kwam, en je moest handmatig lijnen trekken om gerelateerde ideeën met elkaar te verbinden. Zo hanteerde traditioneel machine learning vroeger complexe data.

Relationeel Deep Learning (RDL) is als een nieuw soort bibliothecaris die de pagina's niet uit de boeken rijt. In plaats daarvan bekijkt hij de hele bibliotheek als een levende kaart. Hij begrijpt dat een "Boek" verbonden is met een "Auteur", die verbonden is met een "Universiteit", die op zijn beurt verbonden is met een "Stad". Hij ziet de relaties, niet alleen de geïsoleerde feiten.

Dit artikel introduceert RELBENCH v2, een enorme upgrade van een "trainingsgym" voor deze slimme bibliothecarissen. Hier is wat ze hebben gebouwd:

1. Het Nieuwe Trainingsveld (De Datasets)

De originele gym (RELBENCH v1) had een paar oefenvelden. RELBENCH v2 heeft vier enorme nieuwe stadions toegevoegd, wat het totaal op 11 brengt. Dit zijn geen kleine oefenvelden; het zijn enorme, realistische datawerelden:

  • De Bibliotheek van de Geleerde (rel-arxiv): Een kaart van miljoenen onderzoeksartikelen, auteurs en wie wie citeerde.
  • Het Kantoorgebouw (rel-salt): Een simulatie van verkooporders, verzendroutes en betalingsvoorwaarden van een gigantisch bedrijf.
  • Het Bierliefhebbersforum (rel-ratebeer): Een decennium aan gebruikersbeoordelingen van bieren, brouwerijen en locaties.
  • Het Ziekenhuisarchief (rel-mimic): Geanonimiseerde patiëntendossiers van een groot medisch centrum (met datums naar de toekomst verschoven om privacy te beschermen).

Samen bevatten deze meer dan 22 miljoen rijen data. Het is alsof je de AI een bibliotheek geeft met 22 miljoen boeken om van te leren, allemaal met elkaar verbonden.

2. De Nieuwe Spellen (De Taken)

Het artikel introduceert een nieuw type spel genaamd "Autocomplete".

  • Het Oude Spel (Voorspelling): Stel je een kristallen bol voor. Je geeft de AI data tot vandaag, en het voorspelt iets dat nog niet is gebeurd (zoals "Zal deze klant volgende maand vertrekken?").
  • Het Nieuwe Spel (Autocomplete): Stel je een gedeeltelijk ingevuld formulier voor. De AI ziet sommige velden (zoals "Klantnaam" en "Besteldatum"), maar het vakje "Betaalwijze" is leeg. De AI moet het ontbrekende vakje nu raden, uitsluitend met behulp van de aanwijzingen uit de andere tabellen die het kan zien.

Waarom is dit moeilijk? Het is alsof je probeert het favoriete eten van iemand te raden alleen op basis van hun adres en het tijdstip van de dag, zonder dat ze het je vertellen. De AI moet naar de "buurt" (gerelateerde tabellen) kijken om het erachter te komen. Het artikel toont aan dat de AI hier veel beter in is wanneer het de relaties tussen de tabellen begrijpt, dan wanneer het alleen naar de enkele rij kijkt.

3. De "Universele Adapter" (Integratie van Andere Benchmarks)

De auteurs hebben niet alleen nieuwe ruimtes gebouwd; ze hebben een universele adapter gebouwd die de gym laat verbinden met andere populaire trainingscentra:

  • De Tijdstroom-gym (TGB): Ze hebben datasets die meestal lijken op een stromende rivier van gebeurtenissen vertaald naar hun bibliotheekformaat, zodat de AI er ook op kan oefenen.
  • De 70-Databases-uitdaging (ReDeLEx): Ze hebben verbinding gelegd met een verzameling van 70+ realistische databases, waardoor de AI de kans krijgt om op bijna alles te oefenen.
  • De 4D-toolbox (4DBInfer): Ze hebben een reeks tools toegevoegd die de AI testen vanuit vier verschillende hoeken (data, taken, grafstructuur en modellen) om ervoor te zorgen dat het echt robuust is.

4. De Resultaten: De Kracht van Connectie

Het artikel heeft een reeks tests uitgevoerd waarbij de "Slimme Bibliothecaris" (RDL-modellen) werd vergeleken met de "Oude School-werknemer" (traditionele modellen die de data platmaken).

Het Oordeel: De Slimme Bibliothecaris won bijna elke keer.

  • Of het nu ging om het raden van ontbrekende waarden (Autocomplete), het voorspellen van de toekomst (Voorspelling) of het aanbevelen van het volgende item (Aanbeveling), het model dat de relaties tussen tabellen begreep, presteerde aanzienlijk beter.
  • Zelfs wanneer de data rommelig was of de categorieën ongelijk verdeeld, gebruikte het relationele model de connecties om signalen te vinden die de oude modellen misten.

Samenvatting

Bekijk RELBENCH v2 als de ultieme "Verkeersschool" voor Kunstmatige Intelligentie die probeert complexe databases te begrijpen. Het biedt:

  1. Meer Auto's: 11 enorme, diverse datasets (Academisch, Zakelijk, Consument, Medisch).
  2. Nieuwe Oefeningen: Een nieuwe "Autocomplete"-uitdaging om te testen hoe goed de AI ontbrekende gaten invult met behulp van context.
  3. Een Universele Garage: Tools om verbinding te maken met andere testvelden zodat de AI van alles kan leren.

De belangrijkste conclusie is simpel: Wanneer data verbonden is, moet je het behandelen als een verbonden web, niet als een platte lijst. De modellen die dit doen, winnen de race.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →