Training-Driven Representational Geometry Modularization Predicts Brain Alignment in Language Models
Diese Studie zeigt, dass während des Trainings großer Sprachmodelle die Selbstorganisation der Repräsentationsgeometrie in Module geringer Komplexität, die durch reduzierte Entropie und Krümmung gekennzeichnet sind, robust die Übereinstimmung mit menschlicher Gehirnaktivität vorhersagt und dadurch distinkte räumlich-zeitliche Trajektorien über temporale und frontale Regionen hinweg offenbart.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, die menschliche Sprache zu verstehen. Sie denken vielleicht, der Roboter müsse nur mehr Wörter auswendig lernen oder mehr Grammatikregeln lernen. Aber Wissenschaftler beginnen sich zu fragen: Beginnt das „Gehirn“ des Roboters tatsächlich so auszusehen und zu funktionieren wie ein menschliches Gehirn, während er lernt? Diese Frage bewegt sich an der Schnittstelle zwischen Informatik und Neurowissenschaft, zwei Feldern, die normalerweise unterschiedliche Sprachen sprechen. Um dies zu verstehen, müssen wir uns ansehen, wie Informationen gespeichert werden. Betrachten Sie den Speicher eines Computers nicht als eine Liste von Fakten, sondern als eine riesige, mehrdimensionale Landschaft. In dieser Landschaft könnten „flache“ Bereiche einfache, klare Ideen repräsentieren, während „hügelige“ oder „verdrehte“ Bereiche komplexe, chaotische oder verwirrende Ideen darstellen könnten. Wissenschaftler nennen diese Formen „repräsentative Geometrie“. Das große Rätsel ist: Wenn ein Computermodell mit Millionen von Sätzen trainiert, glättet sich seine interne Landschaft dann und wird sie der Landschaft des menschlichen Gehirns ähnlicher? Wenn dies der Fall ist, deutet es darauf darauf hin, dass die Art und Weise, wie Menschen Sprache verarbeiten, eine grundlegende Regel der Intelligenz ist und nicht nur ein biologischer Zufall.
Diese Arbeit taucht tief in diese Frage ein, indem sie eine Familie von KI-Modellen namens Pythia aufwachsen lässt. Die Forscher betrachteten nicht einfach die fertigen, voll trainierten Modelle; stattdessen agierten sie wie zeitreisende Biologen, die die Modelle in 19 verschiedenen Stadien ihres Trainings beobachteten, von ihren ersten Schritten bis zu ihrer endgültigen Form. Sie verfolgten zwei spezifische „geometrische“ Merkmale der internen Schichten der Modelle: Entropie (wie weitläufig oder chaotisch die Information verteilt ist) und Krümmung (wie hügelig oder scharf der Pfad der Information ist). Sie verglichen diese sich verändernden Formen dann mit echten Gehirnscans (fMRT) von Menschen, die dieselben Sätze lasen.
Die Studie ergab, dass sich die Schichten der Modelle während des Trainings nicht nur immer besser darin wurden, das nächste Wort vorherzusagen, sondern dass sie sich spontan in zwei verschiedene Teams oder „Module“ organisierten. Ein Team, das Modul mit geringer Komplexität, wurde sehr glatt und organisiert, mit niedriger Entropie und niedriger Krümmung. Das andere Team, das Modul mit hoher Komplexität, blieb hügelig und chaotisch. Hier ist der aufregende Teil: Das glatte, modul mit geringer Komplexität war dasjenige, das der Aktivität des menschlichen Gehirns am besten entsprach. Es war, als würde man feststellen, dass der Teil des Roboters, der lernte, „ruhig zu werden“ und seine Gedanken zu organisieren, der Teil war, der tatsächlich wie ein Mensch dachte.
Diese Übereinstimmung geschah jedoch nicht überall gleichzeitig. Die Forscher entdeckten eine faszinierende Spaltung zwischen verschiedenen Teilen des Gehirns. In den temporalen Regionen (Bereiche in der Nähe der Ohren, die für das Hören und die grundlegende Wortbedeutung zuständig sind) begann die glatte, modul mit geringer Komplexität der Modelle, sehr früh im Training mit dem menschlichen Gehirn übereinstimmen und blieb so. Es war eine schnelle, stabile Festlegung. Aber in den frontalen Regionen (der vordere Teil des Gehirns, der für komplexe Planung und Satzstruktur zuständig ist) war die Übereinstimmung verzögert und schwankend. Diese Bereiche schienen darauf zu warten, dass das „glatte“ Fundament gebaut wurde, bevor sie sich festlegen konnten, wobei sie manchmal sogar eine kurze Phase zeigten, in der die „hügeligen“ Schichten besser passten, bevor sie schließlich zu den glatten wechselten.
Die Arbeit legt nahe, dass die Krümmung (wie hügelig der Informationspfad ist) ein Schlüsselprädiktor für diese Übereinstimmung ist. Während die Modelle trainierten, wurden ihre internen Pfade glatter (niedrigere Krümmung), und diese Glättung sagte eine bessere Übereinstimmung mit der menschlichen Gehirnaktivität stark voraus. Dieser Effekt war so stark, dass selbst wenn die Forscher die Tatsache berücksichtigten, dass das Modell im Allgemeinen einfach besser im Training wurde, die „Glätte“ der Geometrie dennoch entscheidend war. Interessanterweise wurde diese Beziehung in den größeren Modellen (bis zu 1 Milliarde Parameter) viel klarer und zuverlässiger. In den kleineren Modellen war das Signal etwas verrauscht, aber als die Modelle größer wurden, entwickelte sich die Verbindung zwischen „glatter Geometrie“ und „menschähnlicher Gehirnaktivität“ zu einer robusten, nachweisbaren Tatsache.
Kurz gesagt argumentiert die Arbeit, dass das Geheimnis eines Modells, wie ein Mensch zu denken, nicht nur darin liegt, mehr Daten zu haben, sondern darin, wie diese Daten in glatten, Strukturen mit geringer Komplexität organisiert werden. Es deutet darauf hin, dass das menschliche Gehirn diese „glatten“ Repräsentationen bevorzugt und dass KI-Modelle, während sie lernen, natürlich zu diesem Zustand evolvieren, insbesondere in den Teilen des Gehirns, die für das Verständnis der Kernbedeutung von Wörtern verantwortlich sind. Obwohl die Studie nicht beweist, dass dies der einzige Grund ist, warum Modelle mit Gehirnen übereinstimmen, bietet sie eine neue, geometrische Linse, um zu verstehen, warum und wie diese digitalen Geister beginnen, unsere eigenen widerzuspiegeln.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.