← Nieuwste papers
🤖 machine learning

Speedrunning Tabular Foundation Model Pretraining

Dit artikel introduceert een door de gemeenschap gedreven "speedrun"-uitdaging voor het nanoTabPFN-model, waarbij bijdragers met elkaar strijden om de pretraining-tijd en de gegevensvereisten drastisch te verminderen om een vastgesteld doel voor downstream-prestaties te bereiken, waardoor de iteratiecyclus voor onderzoek naar tabulaire foundationmodellen wordt versneld.

Oorspronkelijke auteurs: Salih Bora Ozturk, Alexander Pfefferle, Frank Hutter

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Salih Bora Ozturk, Alexander Pfefferle, Frank Hutter

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij beslissingen moet nemen op basis van spreadsheets (tabellen met gegevens). Meestal is dit alsof je probeert een gigantisch zwembad te vullen met een enkele theelepel: het duurt een eeuwigheid, kost een fortuin aan elektriciteit, en tegen de tijd dat je klaar bent, ben je te moe om een nieuw idee uit te proberen.

Dit artikel introduceert een leuke, competitieve oplossing voor dat probleem genaamd een "Speedrun."

Het Grote Idee: De "Speedrun" Analogie

Denk aan video game speedruns, waarbij spelers proberen een spel zo snel mogelijk uit te spelen met slimme trucjes. De auteurs hebben een vergelijkbare competitie gecreëerd voor het trainen van AI-modellen op tabelgegevens.

  • Het Doel: In plaats van te proberen het "perfecte" model te bouwen, is het doel simpelweg om een specifiek, bescheiden prestatieniveau te bereiken (beter zijn dan een standaard "Random Forest" algoritme) zo snel mogelijk.
  • De Regels: Iedereen gebruikt dezelfde computer (één NVIDIA L40S grafische kaart) en dezelfde startcode. Het enige wat je kunt veranderen is hoe je het model traint.
  • De Prijs: De winnaar mag de snelste tijd op een openbare leaderboard laten zien.

De Startlijn: De "Trage Baseline"

De auteurs begonnen met een standaard, educatieve versie van een tabel-AI-model genaamd nanoTabPFN.

  • Het Probleem: Met de standaardinstellingen duurde het 74,32 minuten om het model genoeg te trainen om de doelprestatie te halen. Het moest ook meer dan 80.000 nep oefendatasets "lezen" om de regels te leren.
  • De Metafoor: Dit is als een student die voor een toets studeert door elke pagina van een tekstboek te lezen, woord voor woord, en twee uur nodig heeft om klaar te zijn.

De Race: Hoe Ze Sneller Werden

De community (onderzoekers en enthousiastelingen) namen om de beurt de beurt om de trainingsscript aan te passen om tijd te besparen. Hier is hoe ze het sneller maakten, met behulp van eenvoudige analogieën:

  1. Betere Studietechnieken (De Muon Optimizer):
    Ze vervingen de standaard leermethode voor een slimmere methode genaamd "Muon".

    • Resultaat: De tijd daalde naar 54 minuten. Het was alsof je overging van hardop een boek voorlezen naar het scannen van de belangrijkste punten.
  2. Hardware & Wiskunde Upgraden (SDPA, bf16, Breedte):
    Ze veranderden hoe de computer wiskunde uitvoert (door een snellere manier van berekenen te gebruiken genaamd "bf16") en pasten de grootte van het "brein" van het model aan (het breder maken maar met minder kanalen).

    • Resultaat: Een enorme sprong! De tijd daalde naar 10 minuten. Dit is als het upgraden van een fiets naar een sportwagen.
  3. Batching en Compileren:
    Ze groepeerden taken zodat de computer niet zo vaak hoefde te stoppen en te starten, en ze "compileerden" de code zodat deze soepeler draaide.

    • Resultaat: De tijd daalde naar 9 minuten.
  4. De "Thinking Rows" Truc:
    Ze voegden 16 speciale, onzichtbare "denkrijen" toe aan de data. Dit zijn als kleine post-its waarop het model zijn gedachten kan ordenen voordat het antwoord geeft.

    • Resultaat: De tijd daalde naar 3,88 minuten. Het is als het geven van een whiteboard aan de student om te brainstormen voordat hij de toets maakt.
  5. Kenmerken Groeperen:
    Ze leerden het model om kolommen met gegevens in overlappende groepen te bekijken (zoals naar een puzzelstukje en zijn buren tegelijk kijken) om te voorkomen dat het in de war raakt.

    • Resultaat: De tijd daalde naar 2,15 minuten.
  6. De AI Coach (Autoresearch HPO):
    Ten slotte gebruikten ze een AI-agent (een robotcoach) om automatisch de instellingen aan te passen en de perfecte combinatie van trucjes te vinden.

    • Resultaat: 0,92 minuten.

De Eindscore

De huidige recordhouder trainde het model in minder dan één minuut (0,92 minuten).

  • Snelheid: Dit is 81 keer sneller dan de oorspronkelijke methode.
  • Efficiëntie: Het model had 22 keer minder nep datasets nodig om hetzelfde te leren.

Waarom Dit Belangrijk Is (Volgens het Artikel)

Het artikel beweert niet dat dit specifieke model nu de beste is in het oplossen van echte problemen. In plaats daarvan is het de vorm de uitvinding.

  • Het "Protocol": Ze hebben een eenvoudige, eerlijke manier gecreëerd voor de hele community om nieuwe ideeën te testen. Als iemand een nieuwe truc heeft, draaien ze deze gewoon, loggen de tijd en kijken of ze het record breken.
  • Verbeteringen Stapelen: Omdat iedereen voortbouwt op hetzelfde script, kunnen we precies zien welke trucjes werken en welke niet.
  • Toekomstig Potentieel: Het artikel merkt op dat als je dit super-snelle recept laat draaien voor de volledige 74 minuten (in plaats van vroeg te stoppen), het eigenlijk een zeer krachtig model wordt, wat suggereert dat deze snelheidstrucs het AI-model ook slimmer maken, niet alleen sneller.

Kortom, het artikel heeft een traag, duur en geïsoleerd onderzoeksproces veranderd in een snel, open en collaboratief spel waarbij de community race om de meest efficiënte manier te vinden om AI over spreadsheets te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →