Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled
Diese Studie zeigt, dass bei der Kontrolle der Dimensionserweiterung durch untrainierte große Sprachmodelle die Vorhersagekraft trainierter LLM-Vektoren für menschliche Lesezeiten und fMRT-Daten eine inverse Skalierung aufweist, wobei der Mehrwert des Trainings bei nur wenigen Milliarden Parametern auf Null sinkt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Seit Jahrzehnten beobachten Wissenschaftler, wie Computer lernen zu lesen und zu schreiben, mit einer Geschwindigkeit, die sich fast biologisch anfühlt. Diese Maschinen, bekannt als große Sprachmodelle, werden mit riesigen Bibliotheken menschlicher Texte trainiert, bis sie in der Lage sind, das nächste Wort in einem Satz mit verblüffender Genauigkeit vorherzusagen. Da sie die Sprache so gut beherrschen, begannen Forscher zu fragen, ob diese Maschinen uns nicht nur nachahmen, sondern tatsächlich die Art und Weise widerspiegeln, wie unsere eigenen Gehirne Sprache verarbeiten. Die vorherrschende Hoffnung war, dass diese Modelle, wenn sie größer und komplexer würden, immer besser darin werden würden, vorherzusagen, wie lange ein Mensch braucht, um ein Wort zu lesen, oder wie unsere Gehirne aufleuchten, wenn wir eine Geschichte hören. Diese Idee legte nahe, dass die Architektur dieser digitalen Geister eine Karte zur Architektur des menschlichen Denkens sein könnte, was implizierte, dass jedes Scheitern beim Abgleich mit menschlichen Daten lediglich eine Frage der benötigten Rechenleistung sei.
Ein neuer Bericht von Forschern der Ohio State University und der University of California, San Diego, stellt diese optimistische Sichtweise jedoch infrage. Sie fanden heraus, dass sich die Beziehung zwischen Modellgröße und menschenähnlicher Leistung in einer spezifischen Weise änderte, wenn sie die schiere Menge der von diesen Modellen erzeugten Daten kontrollierten: Der zusätzliche Nutzen des Trainings verschwand. Anstatt den Trainingsprozess so zu gestalten, dass größere Modelle signifikant besser als ihre untrainierten Gegenstücke wurden, zeigten die größten Modelle keine bessere Leistung als die untrainierten Versionen derselben Größe. Die Studie legt nahe, dass der scheinbare Erfolg dieser massiven Systeme weitgehend eine Illusion war, die durch das schiere Volumen der verfügbaren Informationen erzeugt wurde, statt durch ein echtes Verständnis der Sprache. Als die Forscher diesen Vorteil entfernten, schien das Training, das diese Modelle so leistungsfähig macht, keinen zusätzlichen Nutzen gegenüber einer völlig untrainierten Version derselben Maschine zu bieten.
Um zu verstehen, wie sie zu diesem Schluss kamen, muss man zuerst betrachten, wie diese Modelle typischerweise getestet werden. Forscher füttern ein Sprachmodell oft mit einer Geschichte und vergleichen den internen Zustand des Modells mit menschlichen Daten, wie etwa wie lange eine Person bei einem bestimmten Wort pausiert oder wie das Gehirn auf einen Satz reagiert. In früheren Studien schien es, dass größere Modelle, die über mehr interne Variablen verfügen, das menschliche Verhalten konsistent besser vorhersagten. Dies führte zu einer Theorie namens „Qualitäts-Power“-Hypothese: Je größer das Modell, desto mehr ähnelt es dem menschlichen Geist. Aber die Forscher vermuteten einen verborgenen Fehler in dieser Logik. Wenn ein Modell größer wird, wird es nicht nur intelligenter; es produziert auch eine viel größere Anzahl interner Signale, oder Vektoren, die analysiert werden können. Es ist, als würde man einem Schüler einen Test mit doppelt so vielen Fragen geben; selbst wenn der Schüler nichts weiß, gibt das Vorhandensein von mehr Fragen ihm mehr Chancen, die richtige Antwort durch Glück zu erraten. Die Forscher erkannten, dass frühere Studien möglicherweise den Nutzen von mehr Fragen gemessen hatten, anstatt den Nutzen eines besseren Gehirns.
Um dieses Rätsel zu lösen, entwarf das Team eine Reihe von Experimenten, die den Effekt der Größe vom Effekt der Intelligenz trennten. Sie sammelten Daten von fünf verschiedenen Familien von Sprachmodellen, die von kleinen Modellen mit ein paar hundert Millionen Parametern bis hin zu massiven Modellen mit 66 Milliarden Parametern reichten. Sie testeten diese Modelle gegen echte menschliche Daten, einschließlich der Lesezeiten von Menschen beim Lesen natürlicher Geschichten und Gehirnscans von Menschen, die dieselben Geschichten hörten. In ihrem ersten Experiment replizierten sie die früheren Ergebnisse: Als die Modelle größer wurden, schien ihre Vorhersage des menschlichen Verhaltens tatsächlich besser zu werden. Dies bestätigte, dass der „Qualitäts-Power“-Effekt an der Oberfläche sichtbar war.
Doch dann führten sie eine entscheidende Kontrolle ein. Sie nahmen dieselben Modelle und betrachteten sie, bevor sie überhaupt an Text trainiert wurden. Diese untrainierten Modelle haben exakt dieselbe Größe und Struktur wie die trainierten, sind aber im Wesentlichen zufälliges Rauschen, ohne Wissen über Sprache. Durch den Vergleich der trainierten Modelle mit ihren untrainierten Zwillingen konnten die Forscher sehen, wie viel der Verbesserung aus tatsächlichem Lernen resultierte und wie viel einfach daraus entstand, dass eine größere Anzahl interner Signale zur Verfügung stand. Sie verwendeten eine Methode, die einem Reservoir ähnelt, bei dem ein großes, untrainiertes Netzwerk als Quelle für Rohmaterial fungiert, das durch einen einfachen Klassifikator geformt werden kann. Wenn das Training das Modell wirklich menschenähnlicher gemacht hätte, sollte die trainierte Version die untrainierte Version deutlich übertroffen haben, insbesondere wenn die Modelle größer wurden.
Die Ergebnisse waren überraschend. Als die Forscher die Größe der internen Signale kontrollierten, verschwand der zusätzliche Vorteil des Trainings. Tatsächlich zeigten die trainierten Versionen für Modelle mit mehr als ein paar Milliarden Parametern keine bessere Leistung als die untrainierten. In mehreren Datensätzen sank der zusätzliche Nutzen des Trainings auf Null. Das bedeutet, dass die massiven Verbesserungen, die in früheren Studien beobachtet wurden, nicht darauf zurückzuführen waren, dass die größeren Modelle ein tieferes Verständnis der Sprache erlangt hatten, sondern schlichtweg darauf, dass sie über mehr interne Dimensionen verfügten, um die Daten anzupassen. Die Forscher fanden heraus, dass mit zunehmender Größe der Modelle der Beitrag des Trainings zur Anpassung des Modells an den untrainierten Baseline-Wert auf Null sank, anstatt zu steigen. Je größer das Modell wurde, desto weniger fügte der Trainingsprozess der durch die Modellgröße allein bereitgestellten Vorhersagekraft etwas hinzu.
Die Studie untersuchte auch verschiedene Schichten innerhalb der Modelle und prüfte, ob sich die mittleren Abschnitte des Netzwerks, von denen frühere Arbeiten behaupteten, dass sie wichtiger seien, anders verhielten. Sie fanden dasselbe Muster: Der Beitrag des Trainings sank über alle Schichten hinweg auf Null, während die Modelle größer wurden. Selbst als sie ihre statistischen Methoden anpassten, um der Möglichkeit Rechnung zu tragen, dass die Modelle einfach an eine Grenze ihrer Vorhersagefähigkeit für menschliche Daten stießen, blieb der Trend bestehen. Die Forscher kamen zu dem Schluss, dass der Erfolg dieser großen Modelle bei der Vorhersage menschlichen Verhaltens weitgehend auf einen statistischen Effekt zurückzuführen ist, bei dem das Vorhandensein von mehr Variablen eine bessere Anpassung ermöglicht, anstatt ein echliches Spiegelbild der menschlichen Kognition zu sein.
Dieser Befund deutet auf eine erhebliche Diskrepanz zwischen der Art und Weise, wie diese künstlichen Systeme gebaut werden, und der Art und Weise, wie menschliche Gehirne funktionieren, hin. Der Trainingsprozess, der diese Modelle so gut darin macht, Text zu generieren, macht sie nicht zwangsläufig zu besseren Modellen des menschlichen Lesens oder der Gehirnaktivität. Tatsächlich argumentiert die Studie, dass die untrainierten Versionen dieser massiven Netzwerke, die als komplexe Reservoirs zufälliger Verbindungen fungieren, genauso effektiv bei der Vorhersage menschlicher Daten sein könnten wie die teuren, voll trainierten Versionen. Die Forscher schlagen vor, dass zukünftige Studien diese untrainierten Modelle als Standard-Baseline verwenden sollten, um sicherzustellen, dass jegliche Verbesserungen, die dem Training zugeschrieben werden, real sind und nicht nur ein Nebenprodukt der Modellgröße. Während die Idee, dass „größer besser ist“, das Feld jahrelang vorangetrieben hat, legt diese Arbeit nahe, dass wir in Bezug auf die menschliche Sprachverarbeitung an einem Punkt angelangt sind, an dem das Hinzufügen von mehr Größe und Training uns nicht näher zum Verständnis des menschlichen Geistes bringt, sondern uns stattdessen weiter von ihm entfernt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.