TESSERA v2: Scaling Pixel-wise Earth Foundation Models
Dieses Paper präsentiert die größte kontrollierte Skalierungsstudie für pixelweise Erdbeobachtungs-Foundation-Modelle, wobei aufgezeigt wird, dass der Pretraining-Loss ein schlechter Prädiktor für die Downstream-Performance ist, und etabliert eine Rechenressourcen-Allokationsregel, die die Erstellung kompakter, leistungsstarker destillierter Student-Modelle ermöglicht, welche bestehende Produkte übertreffen und gleichzeitig flexible, kostengünstige Matryoshka-Embeddings unterstützen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen die Erde zu verstehen, indem Sie ein riesiges, chaotisches Fotoalbum betrachten. Jede Seite ist ein Bild eines bestimmten Ortes auf dem Planeten, aber die Fotos wurden zu unterschiedlichen Zeiten, mit unterschiedlichen Kameras aufgenommen, und die Hälfte davon ist von Wolken oder Nebel bedeckt. Dies ist die tägliche Realität für Wissenschaftler, die unseren Planeten mithilfe von Satelliten untersuchen. Sie müssen diese chaotischen, unvollständigen Schnappschüsse in eine klare, nutzbare Karte verwandeln, die zeigt, was auf der Erde gerade passiert – sei es die Verfolgung des Waldwachstums, das Zählen von Ernten oder das Aufspüren von Verschmutzung. Um dies zu erreichen, nutzen sie etwas, das man „Foundation Models“ nennt. Stellen Sie sich diese Modelle wie hochintelligente Studenten vor, die jedes jemals gemachte Satellitenfoto gelesen haben. Anstatt Ihnen die rohen, schweren Fotos zu geben, fassen diese Studenten die Informationen in einem winzigen, effizienten „Ausweis“ (einem Embedding) für jeden Ort auf der Erde zusammen. Dieser Ausweis sagt Ihnen alles, was Sie über diesen Ort wissen müssen, ohne dass Sie das ganze Fotoalbum mit sich herumtragen müssen. Die große Frage war jedoch schon immer: Wie trainieren wir diese Studenten so, dass sie die Besten werden, ohne ein Vermögen an Elektrizität und Zeit zu verschwenden?
Dieses Papier mit dem Titel TESSERA V2 ist ein massives Experiment, um genau diese Frage zu beantworten. Die Forscher führten 395 verschiedene Trainingssitzungen durch, um das perfekte Rezept für den Bau dieser erdbeobachtenden KI-Modelle zu finden. Dabei entdeckten sie ein paar überraschende Dinge. Erstens stellten sie fest, dass die übliche Art, den Fortschritt eines Studenten zu bewerten – indem man seine „Hausaufgaben-Note“ (den Pretraining Loss) betrachtet) – tatsächlich ein schlechter Vorhersagewert dafür ist, wie gut er in der realen Welt abschneiden wird. Es ist, als würde ein Student bei einer Übungsprüfung eine Eins bekommen, aber bei der Abschlussprüfung durchfallen; das Papier zeigt, dass das Vertrauen auf diese Note eine enorme Menge an Rechenleistung verschwendet. Stattdessen fanden sie heraus, dass die Gewinnstrategie darin besteht, das „Gehirn“ des Modells (den Encoder) viel größer zu machen und es mit mehr Daten zu füttern, während man den Teil, der die Antworten organisiert (den Projector), klein und fest hält.
Aber es gibt einen Haken: Ein riesiges Gehirn ist teuer im Betrieb. Wenn man einen superintelligenten Lehrer baut, kostet es zu viel, ihn jeden Tag einzusetzen. Deshalb nutzte das Team einen cleveren Trick namens „Distillation“. Sie trainierten ein einziges, riesiges „Lehrer“-Modell mit 2 Milliarden Parametern nach ihren neuen Regeln und brachten dann vier kleinere „Studenten-Modelle“ bei, dessen Denkmuster zu kopieren. Diese Studenten sind winzig im Vergleich zum Lehrer, aber dennoch unglaublich intelligent. Noch cooler ist, dass diese Studenten Antworten in verschiedenen Größen ausgeben können, ähnlich wie eine Matroschka-Puppe. Man kann nach einer winzigen, 16-dimensionalen Antwort fragen, die sehr wenig Speicherplatz beansprucht, aber 92 % der Genauigkeit beibehält, oder nach einer vollen 128-dimensionalen Antwort, wenn man jedes letzte Detail benötigt. Das Ergebnis ist eine Familie von Modellen, die kostengünstiger zu speichern, schneller zu nutzen und genauer bei realen Aufgaben ist als jedes andere getestete offene oder private System – ein Beweis dafür, dass der beste Weg, die Skalierung zu erhöhen, manchmal darin besteht, einen Riesen zu trainieren und ihn dann wieder zu verkleinern.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.