← Nieuwste papers
🤖 machine learning

Understanding the Surprising Generalization Properties of Tabular Foundation Models

Dit artikel onthult dat Tabulaire Foundation Models sterke generalisatie kunnen bereiken door middel van zelfgesuperviseerde pre-training op een enkele echte tabel, wat aantoont dat hun prestaties meer afhangen van het aantal en de kwaliteit van taken en kenmerken dan van massale datasets, en suggereert dat hun in-context learning mechanisme fundamenteel op retrieval gebaseerd is.

Oorspronkelijke auteurs: Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

Gepubliceerd 2026-08-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het uitgestrekte landschap van kunstmatige intelligentie heeft een hardnekkig geloof vastgehouden dat data bestaat uit afzonderlijke, geïsoleerde werelden. Een computerprogramma dat getraind is om handgeschreven cijfers te herkennen, zou volgens deze visie geen enkele hoop hebben om een makelaar te helpen bij het schatten van huizenprijzen, omdat de twee taken geen enkele gemeenschappelijkheid lijken te delen. Dit standpunt behandelt datatabellen als rigide, specifieke puzzels waarbij de regels van de ene onmogelijk van toepassing kunnen zijn op de andere. Echter, een nieuwe generatie AI-modellen, bekend als tabular foundation models, is begonnen dit uitgangspunt uit te dagen. Deze systemen zijn ontworpen om te leren van een stroom voorbeelden die op het moment dat ze gevrada worden om een probleem op te lossen, aan hen worden gepresenteerd, in plaats van door permanent één enkele dataset te memoriseren. Ze werken door te kijken naar een paar gelabelde voorbeelden die op dat moment worden verstrekt en die context te gebruiken om de antwoorden voor nieuwe, ongelabelde rijen te voorspellen. De centrale vraag voor onderzoekers is geweest of deze modellen een enorme, diverse bibliotheek van duizenden verschillende real-world datasets nodig hebben om te leren hoe ze kunnen generaliseren, of dat er een eenvoudiger, meer fundamenteel mechanisme aan het werk is.

Een team van onderzoekers zette zich in om de grenzen van dit leerproces te testen, beginnend met een verrassend en contra-intuïtief experiment. Ze trainden een krachtig AI-model met slechts één enkele, real-world dataset: een tabel met gevectoriseerde afbeeldingen van handgeschreven cijfers. In een standaardopstelling zou men verwachten dat een dergelijk model hopeloos zou falen wanneer het wordt gevraagd om iets zo ongerelateerd als Californische huizenprijzen of statistieken over studenteninschrijvingen te voorspellen. Toch weerstreden de resultaten deze verwachting. Het model, dat alleen de cijferdata had gezien, vertoonde een robuust vermogen om nauwkeurige voorspellingen te doen voor deze totaal andere taken. Deze bevinding suggereerde dat het model niet simpelweg feiten over cijfers aan het memoriseren was, maar een algemenere vaardigheid had geleerd: hoe je naar een reeks voorbeelden kijkt, de voorbeelden vindt die er toe doen, en die gebruikt om een nieuw probleem op te lossen.

Om te begrijpen waarom dit gebeurde, onderzochten de onderzoekers wat een dataset "goed" maakt voor het onderwijzen van deze modellen. Ze analyseerden tientallen verschillende tabellen, variërend van kleine collecties tot enorme archieven, om te zien welke eigenschappen leidden tot de beste prestaties. Ze ontdekten dat het aantal rijen, of instanties, in een tabel verrassend onbelangrijk was. Een dataset met miljoenen rijen maar weinig kolommen leerde het model niet beter aan dan een kleinere dataset met veel kolommen. In plaats daarvan was de cruciale factor het aantal kenmerken, of kolommen, dat beschikbaar was. Een tabel met veel verschillende soorten informatie stelde het model in staat om een bredere variëteit aan logische relaties te oefenen. De onderzoekers ontdekten dat de werkelijke drijfveer van succes niet de brute hoeveelheid data was, maar de diversiteit van de taken die het model kon oefenen. Door verschillende combinaties van kolommen als verschillende problemen te behandelen, kon een enkele tabel duizenden unieke leermomenten bieden. Hoe meer onderscheidende taken een model tijdens zijn training kon oplossen, hoe beter het werd in het afhandelen van nieuwe, ongeziene uitdagingen.

Dit inzicht leidde het team ertoe om anders na te denken over hoe deze modellen voorbereid worden op de echte wereld. De conventionele wijsheid suggereerde dat men, om een sterk model te bouwen, een enorme verzameling datasets moet samenstellen, waarbij duplicaten zorgvuldig worden verwijderd en tabellen die te simpel of slecht gestructureerd lijken worden gefilterd. De onderzoekers testten dit door modellen te trainen op een grote corpus van meer dan 1.700 real-world datasets. Ze ontdekten dat het verwijderen van exacte duplicaten geen verschil maakte voor de uiteindelijke prestaties, en dat het agressief filteren van "zwakke" datasets de het vermogen van het model om te generaliseren juist schaadde. Het bleek dat zelfs een eenvoudige tabel met weinig kenmerken waardevolle oefening kon bieden voor specifieke typen logisch redeneren. De meest effectieve strategie was niet om data weg te gooien, maar om het op een fijner niveau op te schonen. Door kolommen te verwijderen die bijna identiek aan elkaar waren of te veel ontbrekende waarden bevatten, verbeterden de onderzoekers de kwaliteit van de oefentaken zonder de bibliotheek te verkleinen. Deze fijnmazige opschoning verbeterde consequent de prestaties van het model over een breed scala aan benchmarks.

Het artikel concludeert door een nieuwe manier aan te bieden om te begrijpen hoe deze modellen daadwerkelijk werken. In plaats van te fungeren als een enorme encyclopedie die een universele regel voor elke mogelijke situatie opslaat, functioneert het model meer als een bekwame bibliothecaris. Wanneer het wordt geconfronteerd met een nieuw probleem, vertrouwt het niet op een vooraf geschreven antwoordensleutel. In plaats daarvan scant het de voorbeelden die op dat moment worden gepresenteerd, identificeert welke het meest vergelijkbaar zijn met de huidige vraag, en aggregeert hun antwoorden om een voorspelling te vormen. De onderzoekers leverden hiervoor sterk bewijs door aan te tonen dat de modellen die het beste generaliseerden, ook de modellen waren die het meest in staat waren om de juiste informatie uit de gegeven voorbeelden te halen. Ze ontdekten dat het dwingen van het model om te vertrouwen op eenvoudige gelijkenis-matching het model niet kapot maakte; sterker nog, voor zwakkere modellen maakte het het proces meer als een rechttoe-rechtaan zoektocht naar soortgelijke buren, verbeterde dit de resultaten. Dit suggereert dat de magie van deze systemen niet ligt in het opslaan van een complexe, vooraf berekende universum van regels, maar in het leren hoe je de juiste stukjes informatie uit de geboden context vindt en gebruikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →