← Neueste Arbeiten
💬 NLP

How Do Large Language Models Learn Concepts During Continual Pre-Training?

Diese Arbeit untersucht, wie große Sprachmodelle während des kontinuierlichen Pre-Trainings Konzepte erwerben, behalten und vergessen, indem sie deren interne Konzept-Schaltkreise analysiert, wobei sie distinkte zeitliche Lernmuster, Interferenzeffekte und Transferierbarkeitsdynamiken aufzeigt, die neue schaltkreisbewusste Trainingsstrategien zur Milderung des Vergessens motivieren.

Ursprüngliche Autoren: Barry Menglong Yao (UC Davis), Sha Li (Virginia Tech), Yunzhi Yao (UCLA), Minqian Liu (Virginia Tech), Zaishuo Xia (UC Davis), Qifan Wang (Meta AI), Lifu Huang (UC Davis)

Veröffentlicht 2026-08-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Barry Menglong Yao (UC Davis), Sha Li (Virginia Tech), Yunzhi Yao (UCLA), Minqian Liu (Virginia Tech), Zaishuo Xia (UC Davis), Qifan Wang (Meta AI), Lifu Huang (UC Davis)

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Menschen begreifen die Welt, indem sie Dinge in mentale Kategorien einteilen. Wir sehen ein haariges, vierbeiniges Tier und erkennen es sofort als „Hund“, ein Konzept, das mit einem Bündel geteilter Merkmale einhergeht: Er bellt, er hat einen Schwanz und er kann rennen. Diese Fähigkeit, spezifische Beobachtungen zu allgemeinen Ideen zu abstrahieren, ist das Fundament des menschlichen Denkens. Große Sprachmodelle, die leistungsstarken Computerprogramme, die Geschichten schreiben und Fragen beantworten können, versuchen etwas Ähnliches zu tun. Sie werden auf riesigen Ozeanen von Text trainiert, wobei von ihnen erwartet wird, dass sie dieselbe Art von abstrakten Konzepten extrahieren und in ihren internen Systemen speichern. Doch während wir wissen, dass diese Modelle lernen können, haben wir Schwierigkeiten gehabt zu verstehen, wie genau sie dieses Wissen über die Zeit bewahren oder warum sie es manchmal scheinbar verlieren, wenn sie mit neuen Informationen konfrontiert werden.

Jahrelang haben Forscher versucht, in diese digitalen Geister hineinzublicken, um zu sehen, wie sie funktionieren. Einige haben sie mit Fragen getestet, um zu sehen, ob sie sich an Fakten erinnern, während andere versucht haben, die spezifischen Pfade abzubilden, die der Computer nutzt, um Informationen zu verarbeiten. Diese Methoden betrachten jedoch oft isolierte Fakten oder statische Momente in der Zeit. Sie verpassen den dynamischen Prozess, wie ein Modell eine neue Idee lernt, sie stärkt und sie dann potenziell vergisst, wenn es gezwungen wird, etwas anderes zu lernen. Diese Wissenslücke ist kritisch, denn während wir diese Modelle mit neuen Daten aktualisieren, müssen wir wissen, ob sie wirklich ein stabiles Verständnis der Welt aufbauen oder nur Muster auswendig lernen, die mit dem nächsten Update verschwinden werden.

Ein Team von Forschern setzte sich zum Ziel, dieses Rätsel zu lösen, indem es beobachtete, wie künstliche Intelligenz spezifische Konzepte in Echtzeit lernt und vergisst. Sie schufen eine kontrollierte Umgebung unter Verwendung eines Datensatzes aus erfundenen Konzepten. Stellen Sie sich vor, man bringt einem Kind ein Wesen namens „Olre“ bei, das die Fähigkeit besitzt zu rennen, oder ein „Foo“, das vier Beine hat. Da diese Kreaturen in der realen Welt nicht existieren, besitzt der Computer kein Vorwissen über sie. Dies ermöglichte es den Wissenschaftlern, den Lernprozess von Grund auf zu beobachten, frei von jeglichen bereits bestehenden Vorurteilen. Sie trainierten das Modell auf diese fiktiven Fakten und führten es dann einer massiven Menge an, nicht verwandter Texte aus, um zu sehen, was mit seiner Erinnerung an das „Olre“ und das „Foo“ geschehen würde.

Was sie entdeckten, war ein klares, messbares Muster in der Art und Weise, wie sich die interne Struktur des Modells veränderte. Die Forscher fanden heraus, dass der Computer eine Tatsache nicht einfach an einem einzigen Ort speichert; stattdessen baut er ein komplexes Geflecht von Verbindungen, oder einen Schaltkreis, auf, um diese Idee darzustellen. Durch die Analyse der Form und Dichte dieser Geflechte konnten sie vorhersagen, wie gut das Modell ein Konzept gelernt hatte und wie wahrscheinlich es war, dass es es vergessen würde. Sie fanden einen überraschenden Kompromiss: Die Konzepte, die das Modell am schnellsten und stärksten lernte, waren oft diejenigen, die es am leichtesten vergaß, wenn neue Informationen eintrafen. Es scheint, dass gerade die Stärke des anfänglichen Lernens die Erinnerung fragiler machte, wenn das System gezwungen war, sich neu zu organisieren.

Die Studie enthüllte auch, wie verschiedene Ideen miteinander interferieren. Wenn das Modell versuchte, zwei Konzepte, die sich in ihrer Bedeutung sehr ähnlich sind, gleichzeitig zu lernen, hatte es deutlich mehr Schwierigkeiten als bei unverbundenen Konzepten. Die internen Geflechte für diese ähnlichen Ideen überschnitten sich und erzeugten eine Art Verkehrsstau, in dem der Computer sie nicht leicht unterscheiden konnte. Umgekehrt fanden die Forscher heraus, dass das Lernen einer Art von Wissen dem Modell tatsächlich helfen konnte, eine andere zu lernen. Beispielsweise machte es das Modell viel einfacher, später über die Eigenschaften und Funktionen von Dingen zu lernen, wenn man es über die Eigenschaften und Funktionen von Dingen lehrte. Dies deutet darauf hin, dass die Reihenfolge, in der Informationen präsentiert werden, eine tiefe Bedeutung hat; einige Lektionen dienen als Fundament für andere.

Vielleicht am wichtigsten ist, dass die Forscher zeigten, dass diese internen Muster nicht nur abstrakte Beobachtungen sind, sondern auch dazu verwendet werden können, die Modelle selbst zu verbessern. Indem sie die Form der Lernschaltkreise betrachteten, konnten sie identifizieren, welche Konzepte am stärksten von Vergessen bedroht waren. Sie nutzten diese Erkenntnis dann, um eine einfache Trainingsstrategie zu entwickeln: Wann immer das Modell etwas Neues lernte, ließen sie es gelegentlich innehalten und die spezifischen Konzepte wiederholen, die am anfälligsten waren. Diese gezielte Wiederholung, geleitet durch die interne Struktur des Modells, half dem Computer signifikant dabei, sein Wissen zu behalten. Die Arbeit legt nahe, dass wir, indem wir der internen Architektur dessen, wie diese Modelle lernen, Aufmerksamkeit schenken, sie effektiver lehren können, was ihnen hilft, ein stabileres und zuverlässigeres Verständnis der Welt aufzubauen, ganz ähnlich wie ein Schüler, der weiß, welche Notizen er vor einer Prüfung wiederholen muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →