← Neueste Arbeiten
💻 computer science

Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review

Diese Rezension synthetisiert Evidenzen aus repräsentativen, verhaltensbezogenen und mechanistischen Perspektiven auf Subjekt-Verb-Kongruenz, Negation und kompositorische Generalisierung in vortrainierten Transformern, um distinkte Muster von Konvergenz und Fragmentierung aufzuzeigen und schließlich eine Zugänglichkeits-und-Nutzungs-Diagnose vorzuschlagen, die aktuelle Limitationen klärt und zukünftige Forschung über verschiedene Ebenen hinweg leitet.

Ursprüngliche Autoren: Yizhe Wang, Zhenhua Ling

Veröffentlicht 2026-09-16
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yizhe Wang, Zhenhua Ling

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Sprache ist ein System von Regeln, das es uns ermöglicht, einfache Ideen zu nehmen und sie zu unendlichen neuen Gedanken zu kombinieren. Seit Jahrzehnten fragen sich Wissenschaftler, ob die massiven Computerprogramme, die heute flüssigen Text schreiben und komplexe Fragen beantworten können, diese Regeln wirklich gelernt haben oder ob sie lediglich Muster nachahmen, die sie zuvor gesehen haben. Diese Programme, bekannt als vortrainierte Sprachmodelle, werden mit riesigen Mengen menschlicher Texte trainiert. Sie können Sätze produzieren, die vollkommen natürlich klingen, was viele zu der Annahme führt, dass sie Grammatik und Bedeutung auf die gleiche Weise verstehen wie Menschen. Das Produzieren der richtigen Wörter ist jedoch nicht dasselbe wie das Wissen darüber, warum diese Wörter zusammengehören. Ein Programm könnte einen Satz durch Zufall oder durch das Nutzen einer Abkürzung richtig bilden, ohne die zugrunde liegende Logik tatsächlich zu erfassen. Um dieses Rätsel zu lösen, haben Forscher drei verschiedene Wege entwickelt, um in diese Modelle hineinzublicken: zu prüfen, welche Informationen in ihrem internen Speicher gespeichert sind, zu testen, was sie tatsächlich in ihrem Output produzieren, und die spezifischen Pfade nachzuverfolgen, die dazu führen, dass sie eine Entscheidung treffen.

Ein neuer Rückblick der Forscher Yizhe Wang und Zhenhua Ling führt diese drei Arten des Hinsehens zusammen, um zu sehen, ob sie dieselbe Geschichte erzählen. Die Autoren konzentrierten sich auf drei spezifische Bereiche der Sprache, die entscheidend für das Verständnis der Funktionsweise dieser Modelle sind: wie Verben mit ihren Subjekten übereinstimmen, wie das Wort „nicht“ die Bedeutung eines Satzes verändert und wie die Modelle vertraute Teile kombinieren, um neue, komplexe Ideen zu erschaffen. Durch das Sammeln und Vergleichen hunderter Studien, die diese drei verschiedenen Methoden verwendeten, fanden die Forscher heraus, dass die Antwort ganz davon abhängt, welchen Teil der Sprache man fragt. Manchmal decken sich die Belege aus allen drei Methoden perfekt; ein andermal erzählen die Methoden widersprüchliche Geschichten, die Lücken im tatsächlichen Wissen der Modelle aufzeigen.

Die klarste Erfolgsgeschichte, die die Forscher fanden, betrifft die Subjekt-Verb-Kongruenz, also die Regel, dass ein singuläres Subjekt ein singuläres Verb benötigt, wie „the cat runs“ (die Katze rennt), während ein pluralisches Subjekt ein pluralisches Verb benötigt, wie „the cats run“ (die Katzen rennen). In diesem Bereich stimmen die drei verschiedenen Arten, die Modelle zu betrachten, überein. Wenn Forscher in die internen Zustände des Modells blickten, konnten sie ein klares Signal dafür finden, ob ein Nomen im Singular oder Plural steht. Wenn sie den Output des Modells testeten, wählte es fast immer die korrekte Verbform. Am wichtigsten ist, dass sich das Verhalten des Modells auf eine vorhersagbare Weise änderte, wenn die Forscher intervenierten, um dieses interne Signal zu verändern, was das Modell dazu zwang, das falsche Verb zu wählen. Diese Konvergenz deutet darauf hin, dass diese Modelle für einfache grammatikalische Regeln die Beziehung tatsächlich gelernt haben und sie nutzen, um Entscheidungen zu treffen.

Das Bild wird viel komplizierter, wenn man die Negation betrachtet, also die Art und Weise, wie die Modelle mit dem Wort „nicht“ umgehen. Hier stimmen die drei Perspektiven nicht überein. Die internen Kontrollen zeigen, dass die Modelle die Anwesenheit des Wortes „nicht“ erkennen und grob verstehen können, worauf es sich in einem Satz bezieht. Wenn die Modelle jedoch gebeten werden, Texte zu produzieren oder Fragen basierend auf einem negierten Satz zu beantworten, scheitern sie oft daran, die korrekte Bedeutung anzuwenden. Sie erkennen das Wort „nicht“, handeln aber dennoch so, als wäre der Satz positiv. Die Forscher fanden heraus, dass die Modelle zwar das Marker-Wort erkennen, aber die Wahrheit der Aussage nicht zuverlässig umkehren. Es ist, als ob das Modell das Schild sieht, aber der Anweisung, die es gibt, nicht folgt. Diese Diskrepanz bedeutet, dass die Modelle zwar die Informationsteile besitzen, diese aber nicht konsistent nutzen, um die volle Bedeutung zu verstehen.

Der dritte Bereich, der die Kombination verschiedener Teile der Sprache zur Erzeugung neuer Bedeutungen umfasst, zeigt die größte Verwirrung. Dies ist die Fähigkeit, bekannte Wörter und Regeln zu nehmen und sie auf Situationen anzuwenden, die das Modell noch nie gesehen hat. Die Belege hier sind fragmentiert. Einige Studien zeigen, dass die Modelle einfache Kombinationen bewältigen können, insbesondere wenn die Forscher Hinweise geben oder die Aufgabe in kleinere Schritte unterteilen. Andere Studien zeigen, dass die Modelle oft scheitern, wenn sie allein gelassen werden, um komplexe Denkketten eigenständig zu durchlaufen. Das Problem ist, dass die verschiedenen Studien nicht dasselbe untersuchen. Einige testen, ob das Modell ein Muster erkennen kann, während andere testen, ob es eine neue Idee aus dem Stegreif aufbauen kann. Da die Forscher keine einzige, konsistente Methode fanden, um diese Fähigkeit über alle Studien hinweg zu messen, konnten sie nicht schlussfolgern, ob die Modelle tatsächlich über eine allgemeine Fähigkeit zum Kombinieren von Ideen verfügen oder ob sie nur gut in spezifischen, engen Tricks sind.

Die Autoren des Rückblicks legen nahe, dass diese unterschiedlichen Ergebnisse dadurch entstehen, dass einige Sprachmerkmale leichter zu isolieren und zu nutzen sind als andere. Für die Subjekt-Verb-Kongruenz ist das Merkmal einfach und isoliert, sodass das Modell es finden und nutzen kann. Bei der Negation kann das Modell das Marker-Wort zwar finden, aber Schwierigkeiten haben, es zu nutzen, um die gesamte Bedeutung zu verändern. Bei komplexen Kombinationen ist das Merkmal so weit verbreitet und schwer zu definieren, dass das Modell es nicht einmal klar isolieren kann. Die Forscher kommen zu dem Schluss, dass wir nicht davon ausgehen können, dass diese Modelle Sprache in einem allgemeinen Sinne kennen. Stattdessen ist ihr Wissen auf die jeweilige Aufgabe bezogen. Sie sind exzellent in einigen Dingen, wie dem Abgleichen von Verben, aber inkonsistent in anderen, wie dem Verständnis von Negation, und bei der komplexesten Aufgabe, aus alten Teilen neue Ideen zu erschaffen, sind sie noch unbewiesen. Dieser Befund verändert die Art und Weise, wie wir diese Systeme bewerten sollten: Wir können nicht nur schauen, ob sie die richtige Antwort erhalten, sondern wir müssen auch prüfen, ob sie auch die richtige Logik verwenden, um dorthin zu gelangen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →