← Nieuwste papers
🤖 machine learning

LUCoS: Latent Unsupervised Context Selection for Tabular Foundation Models

Het artikel stelt LUCoS voor, een onbewaakte methode voor het selecteren van gelabelde instanties in tabulair leren met weinig labels door gebruik te maken van de latente geometrie van onbewaakte embeddings in plaats van onbetrouwbare ruwe kenruimtes, wat leidt tot prestaties op het hoogste niveau op 67 datasets door effectieve dekking en representatiekwaliteit te waarborgen.

Oorspronkelijke auteurs: Oroel Ipas, Guillermo Gomez-Trenado, Rocío Romero-Zaliz, Isaac Triguero

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Oroel Ipas, Guillermo Gomez-Trenado, Rocío Romero-Zaliz, Isaac Triguero

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het Dilemma van het "Leeg Canvas"

Stel je voor dat je een chef bent (het AI-model) die ongelooflijk talentvol is in koken, maar je hebt slechts een kleine hoeveelheid ingrediënten (gelabelde data) om mee te werken. Je hebt een enorme voorraadkast vol met rauwe, ongemarkeerde groenten en kruiden (de ongelabelde data).

In de wereld van Tabulaire Foundation Modellen (zoals TabPFN) leert de chef niet door duizenden maaltijden te koken en het recept aan te passen. In plaats daarvan leert de chef via In-Context Learning (ICL). Dit betekent dat de chef kijkt naar een klein "proefmenu" van een paar voorbeelden (de contextset) en direct uitwerkt hoe de rest van de maaltijd op basis van die voorbeelden moet worden bereid.

De Haken en Ogen: De chef is extreem gevoelig voor welke voorbeelden je op dat proefmenu zet.

  • Als je de chef 5 willekeurige voorbeelden geeft, kan het zijn dat ze raden dat het recept "Kruidig" is.
  • Als je de chef 5 zorgvuldig gekozen voorbeelden geeft, kan het zijn dat ze raden dat het "Zoet en Hartig" is.
  • Beide sets hebben hetzelfde aantal items, maar de ene leidt tot een heerlijke maaltijd en de andere tot een ramp.

Het artikel vraagt zich af: Hoe kiezen we de beste 5 voorbeelden om aan de chef te laten zien als we de antwoorden (labels) nog niet kennen? Dit wordt het "cold-start"-probleem genoemd.

De Oude Manier: Gissen in het Donker

Meestal, als mensen proberen deze voorbeelden te kiezen zonder de antwoorden te kennen, kijken ze naar de ruwe data.

  • De Analogie: Stel je voor dat je probeert de beste 5 vruchten uit een krat te kiezen door ze te bekijken in een donkere kamer waar het licht uit is en de vruchten door elkaar liggen (appels naast stenen, bananen naast soepblikken).
  • Het Probleem: Tabulaire data is rommelig. Het bevat getallen, categorieën, ontbrekende waarden en vreemde schalen. Het meten van de "afstand" tussen twee rijen data in deze ruwe staat is als proberen de afstand tussen een steen en een banaan te meten met een liniaal die voor soep bedoeld is. Het heeft geen zin.
  • Het Resultaat: Het artikel vond dat als je gewoon willekeurige vruchten kiest of probeert "verschillende" vruchten te kiezen op basis van deze rommelige weergave, je vaak slechter presteert dan als je ze volledig willekeurig kiest.

De Oplossing: LUCoS (De "Magische Vertaler")

De auteurs stellen een nieuwe methode voor genaamd LUCoS (Latent Unsupervised Context Selection).

Stap 1: De Magische Vertaler (De Embedding)
In plaats van naar de ruwe, rommelige data te kijken, gebruikt LUCoS een speciale "vertaler" (een onbewaakte AI-model genaamd TabClustPFN).

  • De Analogie: Deze vertaler neemt alle rommelige vruchten en groenten en herschikt ze in een perfect georganiseerd, high-tech magazijn. In dit nieuwe magazijn zijn vergelijkbare items op natuurlijke wijze bij elkaar gegroepeerd. Appels liggen bij appels, bananen bij bananen, en stenen ver weg van soep.
  • Waarom het werkt: Deze "latente ruimte" (het nieuwe magazijn) creëert een geometrie waarbij "afstand" daadwerkelijk zinvol is. Items die dicht bij elkaar liggen in deze nieuwe ruimte, zijn op een manier die relevant is voor de taak, eigenlijk vergelijkbaar.

Stap 2: De Slimme Kiezer (K-Medoids)
Zodra de data in dit georganiseerde magazijn staat, gebruikt LUCoS een eenvoudige geometrische regel om de voorbeelden te kiezen.

  • De Analogie: Stel je voor dat je 5 vertegenwoordigers moet kiezen om aan de chef te laten zien. In het georganiseerde magazijn kies je gewoon de 5 vruchten die het meest "centraal" zijn binnen hun groepen. Je kiest de appel die precies in het midden van de appelstapel ligt, de banaan in het midden van de bananenstapel, enzovoort.
  • De Regel: Dit heet K-Medoids. Het zorgt ervoor dat je een goede dekking van het hele magazijn hebt zonder duplicaten te kiezen.

Stap 3: Het Labelen
Je neemt die 5 specifieke vruchten uit het magazijn, koppelt ze terug aan de echte wereld en vraagt een expert om ze te labelen (bijv. "Dit is een appel"). Nu heb je je "proefmenu".

Stap 4: De Voorspelling
Je voert dit perfecte proefmenu in bij de TabPFN-chef. De chef kijkt naar deze hoogwaardige voorbeelden en voorspelt de rest van de data met verbazingwekkende nauwkeurigheid.

Wat de Experimenten Toonden

De auteurs testten dit op 67 verschillende datasets (zoals gezondheidszorggegevens, financiële data, enz.) met zeer weinig labels (van 1 voorbeeld per categorie tot 32).

  1. De "Orakel"-Test: Ze bewezen eerst dat als je zou kunnen magisch de antwoorden kennen en de absolute beste 5 voorbeelden zou kiezen, het model veel beter zou presteren. Dit bewees dat er een enorme "kloof" was om te overbruggen.
  2. LUCoS versus Willekeurig: LUCoS dichte een aanzienlijk deel van die kloof zonder ooit de labels te hebben gezien.
  3. Het "Reddings"-Effect:
    • Bij zeer lage budgetten (1-2 voorbeelden): Het simpele feit dat je enige gestructureerde voorbeelden kiest (dekking) hielp.
    • Bij gemiddelde budgetten (4-16 voorbeelden): Hier schitterde LUCoS. De oude methode (kiezen uit de rommelige ruwe data) begon eigenlijk te falen en presteerde slechter dan willekeurig gissen. LUCoS bleef echter goed presteren omdat het de "georganiseerde magazijn" (de latente ruimte) gebruikte.
    • De Conclusie: Het artikel vond dat de geometrie van de ruimte belangrijker is dan de complexiteit van de kiezer. Het gebruik van een eenvoudige kiezer in een slimme ruimte (LUCoS) verslaat een complexe kiezer in een domme ruimte.

Samenvatting in één Zin

LUCoS lost het probleem op van het kiezen van de beste trainingsvoorbeelden voor AI door eerst rommelige data te vertalen naar een schone, georganiseerde "mentale kaart" waar vergelijkbare dingen op natuurlijke wijze bij elkaar groeperen, waardoor een eenvoudige geometrische regel de perfecte voorbeelden kan kiezen waar de AI van kan leren, zelfs wanneer er nog geen labels beschikbaar zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →