On the Power of Foundation Models
Dieser Beitrag nutzt die Kategorientheorie, um zu zeigen, dass promptbasiertes Lernen zwar streng auf darstellbare Aufgaben beschränkt ist, ein hinreichend leistungsfähiges Fundamentmodell mit Feinabstimmung jedoch theoretisch jede nachgelagerte Aufgabe innerhalb der durch seine Vorab-Aufgabe definierten Kategorie lösen und durch strukturelle Abbildung auf nicht gesehene Objekte verallgemeinern kann.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Die große Frage: Kann ein Super-Gehirn alles tun?
Stellen Sie sich einen Schüler vor, der jedes Buch im Universum gelesen hat, unendlich viel Zeit zum Lernen hat und bei seinen Übungstests niemals einen Fehler macht. Die Autoren stellen eine einfache Frage: Wenn dieser Schüler bei seinen Übungstests perfekt ist, kann er dann automatisch jedes neue Problem lösen, das Sie ihm vorlegen?
In der Welt der KI ist dieser „Schüler" ein Foundation Model (wie die hinter ChatGPT oder Bildgeneratoren). Die „Übungstests" werden Pretext Tasks genannt (z. B. das Vorhersagen des nächsten Wortes in einem Satz oder das Raten, wie ein Bild gedreht wurde).
Das Paper argumentiert, dass bestehende Theorien (über die Menge der Daten oder die Größe des Computers) dies nicht beantworten können. Stattdessen verwenden die Autoren einen Zweig der Mathematik namens Kategorientheorie (denken Sie daran als die „Grammatik der Strukturen"), um herauszufinden, was diese Modelle können und was nicht.
Sie fanden zwei Hauptregeln heraus, wie diese Modelle neue Dinge lernen:
Regel #1: Das „Prompt"-Limit (Die Bibliotheksausweis-Analogie)
Das Szenario: Sie möchten, dass das Modell eine neue Aufgabe erledigt (z. B. Katzen auf Fotos zu identifizieren), aber Sie wollen es nicht neu trainieren. Sie geben ihm einfach eine spezifische Anweisung oder einen „Prompt" (wie einen Bibliotheksausweis, auf dem steht: „Finde Katzen").
Die Erkenntnis: Das Modell kann die neue Aufgabe nur lösen, wenn diese bereits in der Struktur seines ursprünglichen Trainings „versteckt" ist.
Die Analogie: Stellen Sie sich das Modell als eine Bibliothek vor.
- Die Pretext Task (das Training) ist die Art und Weise, wie die Bibliothek ihre Bücher organisiert hat. Wenn die Bibliothek Bücher nur nach „Farbe" organisiert hat, sind die Bücher nach Rot, Blau und Grün sortiert.
- Prompt Tuning ist wie die Frage an den Bibliothekar: „Können Sie mir ein Buch über Geschichte finden?"
- Das Ergebnis: Wenn die Bibliothek nur nach Farbe organisiert war, kann der Bibliothekar kein Buch über Geschichte finden, selbst wenn er das beste Gedächtnis der Welt hat. Die Kategorie „Geschichte" existiert schlichtweg nicht in der Struktur der Bibliothek.
- Der Beweis des Papers: Die Autoren beweisen, dass, wenn die Trainingstask (wie das Raten von Bildrotationen) dem Modell nur etwas über „Drehen" beibringt, das Modell nicht dazu gebracht werden kann, komplexe Aufgaben wie „Segmentierung" (Ausschneiden) von Objekten zu erledigen, weil das Konzept des „Ausschneidens" nicht in die Struktur der Bibliothek eingebaut wurde.
Fazit: Wenn Sie das Modell nur Schach spielen lehren, können Sie es nicht einfach durch einen „Prompt" dazu bringen, Fußball zu spielen. Die neue Aufgabe muss durch die alte Struktur darstellbar sein.
Regel #2: Die Kraft des „Fine-Tunings" (Der Hauptschlüssel-Analogie)
Das Szenario: Sie sind bereit, dem Modell ein wenig neues Training (Fine-Tuning) mit einem kleinen Datensatz für die neue Aufgabe zu geben.
Die Erkenntnis: Dies ist viel mächtiger. Wenn das Modell während des ursprünglichen Trainings die „Struktur" der Welt gut genug gelernt hat, kann es jede neue Aufgabe lernen, sofern Sie ihm genügend Ressourcen (Daten und Rechenleistung) geben, um die Punkte zu verbinden.
Die Analogie: Stellen Sie sich das Modell als einen Hauptschlüssel vor, der so gefeilt wurde, dass er in die Schlösser eines bestimmten Gebäudes passt (die Pretext Task).
- Fine-Tuning ist wie das Nehmen dieses Hauptschlüssels und das leichte Feilen daran, damit er zu einer neuen Tür in einem anderen Gebäude passt.
- Das Ergebnis: Solange der Hauptschlüssel das Wesentliche der Schlösser des ersten Gebäudes erfasst hat, können Sie ihn umformen, um fast jede Tür der Welt zu öffnen.
- Der Beweis des Papers: Die Autoren zeigen, dass, wenn das Modell „ideal" ist (die Trainingsstruktur perfekt gelernt hat), es alle notwendigen Informationen enthält, um jede nachgelagerte Aufgabe zu lösen. Die Trainingsdaten für die neue Aufgabe dienen lediglich als Leitfaden, um dem Modell zu zeigen, wie es diese Informationen umgestalten soll.
Fazit: Fine-Tuning ist nicht durch die „Darstellbarkeit" des Prompts begrenzt. Wenn das Fundament stark ist, kann das Modell an fast alles angepasst werden.
Regel #3: Die „Magische Brücke" (Die Übersetzer-Analogie)
Das Szenario: Was passiert, wenn wir verschiedene Arten von Modellen kombinieren, wie eines, das Text versteht, und eines, das Bilder versteht (Multimodales Lernen)?
Die Erkenntnis: Das Paper präsentiert ein „Generalization Theorem". Es besagt, dass, wenn Sie eine perfekte Brücke (eine mathematische Abbildung) zwischen zwei verschiedenen Welten bauen (z. B. Text und Bilder), die Struktur der einen Welt in der anderen erhalten bleibt.
Die Analogie: Stellen Sie sich ein Wörterbuch vor, das „Text" perfekt in „Bilder" übersetzt.
- In der Textwelt haben Sie das Konzept eines „Avocado-Stuhls" (ein Stuhl in Form einer Avocado). Dieses Objekt mag in der realen Welt nicht existieren, und kein Foto davon existiert in Ihren Trainingsdaten.
- Da die Textwelt jedoch eine logische Struktur hat, in der „Avocado" und „Stuhl" kombiniert werden können, und Ihr Wörterbuch (das Modell) diese Struktur beim Übersetzen in die Bildwelt perfekt bewahrt...
- Das Ergebnis: Kann das Modell ein perfektes Bild eines Avocado-Stuhls „halluzinieren" oder generieren, obwohl es noch nie eines gesehen hat. Es hat das Bild nicht auswendig gelernt; es verstand die Beziehung zwischen den Wörtern und wandte diese Struktur auf die Bildwelt an.
Der Beweis des Papers: Dies erklärt, warum Modelle wie DALL-E 2 oder CLIP Bilder von Dingen erstellen können, die nicht in ihren Trainingssets existieren. Sie kopieren nicht nur; sie nutzen die strukturelle Logik der Sprache, um neue Bilder zu bauen.
Zusammenfassung der Behauptungen des Papers
- Prompting ist begrenzt: Sie können ein Modell nur dazu auffordern, Dinge zu tun, die bereits in die Art und Weise „eingebaut" sind, wie es trainiert wurde. Wenn das Training ihm nicht die Struktur der neuen Aufgabe beigebracht hat, wird ein einfacher Prompt nicht funktionieren.
- Fine-Tuning ist mächtig: Wenn Sie bereit sind, ein wenig zusätzliches Training durchzuführen, kann ein Modell, das eine gute Struktur gelernt hat, angepasst werden, um fast jede Aufgabe zu lösen.
- Struktur erschafft Neues: Indem die Struktur einer Domäne (wie Text) perfekt auf eine andere (wie Bilder) abgebildet wird, können Modelle Dinge generieren, die noch nie existiert haben (wie einen Avocado-Stuhl), weil sie den logischen Regeln der Struktur folgen und nicht nur Bilder auswendig lernen.
Die Autoren betonen, dass sie nicht von spezifischen Netzwerkgrößen oder Datenmengen sprechen, sondern vielmehr von der logischen Struktur der Aufgaben selbst. Sie verwenden Mathematik, um zu beweisen, dass die „Form" der Trainingstask die „Form" dessen bestimmt, was das Modell schließlich tun kann.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.