← Nieuwste papers
🤖 machine learning

On the Power of Foundation Models

Dit artikel maakt gebruik van categorietheorie om aan te tonen dat hoewel prompt-gebaseerd leren strikt beperkt is tot representeerbare taken, een voldoende krachtig fundamenteel model met fine-tuning theoretisch elke downstream-taak binnen de categorie die door zijn pretext-taak wordt gedefinieerd kan oplossen en kan generaliseren naar ongezichten objecten via structurele mapping.

Oorspronkelijke auteurs: Yang Yuan

Gepubliceerd 2026-04-27
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yang Yuan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Kan een Super-brein Alles Doen?

Stel je een student voor die elk boek in het universum heeft gelezen, oneindig veel tijd heeft om te studeren en nooit een fout maakt op zijn oefentoetsen. De auteurs stellen een simpele vraag: Als deze student perfect is in zijn oefentoetsen, kan hij dan automatisch elk nieuw probleem oplossen dat je hem voorschotelt?

In de wereld van AI is deze "student" een Foundation Model (zoals die achter ChatGPT of beeldgeneratoren). De "oefentoetsen" worden pretext-taken genoemd (bijvoorbeeld: het voorspellen van het volgende woord in een zin, of raden hoe een afbeelding is gedraaid).

Het artikel betoogt dat bestaande theorieën (over hoeveel data je hebt of hoe groot de computer is) dit niet kunnen beantwoorden. In plaats daarvan gebruiken de auteurs een tak van de wiskunde genaamd Categorietheorie (denk hieraan als de "grammatica van structuren") om uit te zoeken wat deze modellen wel en niet kunnen.

Ze vonden twee hoofdregels over hoe deze modellen nieuwe dingen leren:


Regel #1: De "Prompt"-limiet (De Bibliotheekpas-analogie)

Het Scenario: Je wilt dat het model een nieuwe klus doet (zoals katten herkennen op foto's), maar je wilt het niet opnieuw trainen. Je geeft het gewoon een specifieke instructie of "prompt" (zoals een bibliotheekpas die zegt: "Vind katten").

De Bevinding: Het model kan de nieuwe klus alleen oplossen als de klus al "verborgen" zit in de structuur van zijn oorspronkelijke training.

De Analogie: Stel je het model voor als een Bibliotheek.

  • De Pretext-taak (training) is hoe de bibliotheek zijn boeken heeft georganiseerd. Als de bibliotheek boeken alleen heeft georganiseerd op "Kleur", dan zijn de boeken gesorteerd op Rood, Blauw en Groen.
  • Prompt Tuning is alsof je de bibliothecaris vraagt: "Kun je een boek voor me vinden over Geschiedenis?"
  • Het Resultaat: Als de bibliotheek alleen op Kleur was georganiseerd, kan de bibliothecaris geen boek over Geschiedenis vinden, zelfs niet als hij het beste geheugen ter wereld heeft. De categorie "Geschiedenis" bestaat simpelweg niet in de structuur van de bibliotheek.
  • Het Bewijs uit het Artikel: De auteurs bewijzen dat als de trainingstaak (zoals het raden van afbeeldingsrotaties) het model alleen leert over "draaien", het model niet via prompts complexe taken kan uitvoeren zoals "segmenteren" (uitsnijden) van objecten, omdat het concept van "uitsnijden" niet in de structuur van de bibliotheek was ingebouwd.

Conclusie: Als je het model alleen leert schaken, kun je het niet zomaar "prompten" om voetbal te spelen. De nieuwe taak moet representeerbaar zijn door de oude structuur.


Regel #2: De "Fine-Tuning"-kracht (De Meestersleutel-analogie)

Het Scenario: Je bent bereid het model een beetje nieuwe training te geven (Fine-Tuning) met een kleine dataset voor de nieuwe klus.

De Bevinding: Dit is veel krachtiger. Als het model tijdens de initiële training de "structuur" van de wereld goed genoeg heeft geleerd, kan het elke nieuwe taak leren, mits je het voldoende middelen (data en rekenkracht) geeft om de punten te verbinden.

De Analogie: Stel je het model voor als een Meestersleutel die is geslepen om te passen in de sloten van een specifiek gebouw (de Pretext-taak).

  • Fine-Tuning is alsof je die Meestersleutel neemt en hem lichtjes vijlt om te passen in een nieuwe deur in een ander gebouw.
  • Het Resultaat: Zolang de Meestersleutel de essentie van de sloten van het eerste gebouw heeft vastgelegd, kun je hem herschikken om bijna elke deur in de wereld te openen.
  • Het Bewijs uit het Artikel: De auteurs tonen aan dat als het model "ideaal" is (de trainingstructuur perfect heeft geleerd), het alle benodigde informatie bevat om elke downstream-taak op te lossen. De trainingdata voor de nieuwe taak fungeert gewoon als een gids om het model te laten zien hoe het die informatie moet herschikken.

Conclusie: Fine-tuning is niet beperkt door de "representeerbaarheid" van de prompt. Als de basis sterk is, kan het model worden aangepast aan bijna alles.


Regel #3: De "Magische Brug" (De Vertaler-analogie)

Het Scenario: Wat gebeurt er als we verschillende soorten modellen combineren, zoals een dat tekst begrijpt en een dat afbeeldingen begrijpt (Multimodaal Leren)?

De Bevinding: Het artikel presenteert een "Generalisatietheorema". Het stelt dat als je een perfecte brug bouwt (een wiskundige mapping) tussen twee verschillende werelden (bijvoorbeeld Tekst en Afbeeldingen), de structuur van de ene wereld behouden blijft in de andere.

De Analogie: Stel je een Woordenboek voor dat "Tekst" perfect vertaalt naar "Afbeeldingen".

  • In de Tekst-wereld heb je het concept van een "Avocado-stoel" (een stoel in de vorm van een avocado). Dit object bestaat misschien niet in de echte wereld, en er bestaat geen foto ervan in je trainingsdata.
  • Echter, omdat de Tekst-wereld een logische structuur heeft waarin "Avocado" en "Stoel" kunnen worden gecombineerd, en je Woordenboek (het model) die structuur perfect behoudt bij het vertalen naar de Afbeeldingen-wereld...
  • Het Resultaat: Kan het model een perfecte afbeelding van een Avocado-stoel "hallucineren" of genereren, zelfs al heeft het er nooit een gezien. Het heeft de afbeelding niet onthouden; het begreep de relatie tussen de woorden en paste die structuur toe op de wereld van afbeeldingen.

Het Bewijs uit het Artikel: Dit verklaart waarom modellen zoals DALL-E 2 of CLIP afbeeldingen kunnen maken van dingen die niet bestaan in hun trainingssets. Ze kopiëren niet alleen; ze gebruiken de structurele logica van taal om nieuwe afbeeldingen te bouwen.


Samenvatting van de Claims van het Artikel

  1. Prompten is Beperkt: Je kunt een model alleen dingen laten doen die al "ingebouwd" zijn in de manier waarop het is getraind. Als de training het de structuur van de nieuwe taak niet heeft geleerd, werkt een simpele prompt niet.
  2. Fine-Tuning is Krachtig: Als je bereid bent wat extra training te doen, kan een model dat een goede structuur heeft geleerd worden aangepast om bijna elke taak op te lossen.
  3. Structuur Creëert Nieuwe Dingen: Door de structuur van één domein (zoals tekst) perfect af te beelden op een ander (zoals afbeeldingen), kunnen modellen dingen genereren die nog nooit hebben bestaan (zoals een avocado-stoel), omdat ze de logische regels van de structuur volgen, en niet zomaar foto's onthouden.

De auteurs benadrukken dat ze het niet hebben over specifieke netwerkgroottes of hoeveelheden data, maar over de logische structuur van de taken zelf. Ze gebruiken wiskunde om te bewijzen dat de "vorm" van de trainingstaak de "vorm" dicteert van wat het model uiteindelijk kan doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →