Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning
Dieser Artikel untersucht kontinuierliches zusammengesetztes Schlussfolgern in Transformern mithilfe eines erweiterten LEGO-Rahmens und zeigt auf, dass zwar feedforward-BERT-Modelle aufgrund fest verankerter Shortcut-Lösungen scheitern, rekurrente ALBERT-Modelle jedoch durch das Erlernen algorithmischer „for-loop"-Strategien, die durch trainingsübergreifendes Lernen weiter verbessert werden können, eine überlegene Leistung aufweisen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie lehren einen Roboter, eine Reihe von Rätseln zu lösen. Die Rätsel sind nicht einfach zufällig; sie sind Variationen derselben zugrunde liegenden Logik. Ein Rätsel könnte beispielsweise verlangen, ein Dreieck zu drehen, das nächste, es zu spiegeln, und das dritte, beides zu tun. Das Ziel ist es zu prüfen, ob der Roboter die Logik des ersten Rätsels lernen und sie nutzen kann, um das zweite und dritte sofort zu lösen, ohne zu vergessen, wie man das erste macht.
Dieser Artikel untersucht, wie zwei beliebte Arten von KI-„Gehirnen" (genannt BERT und ALBERT) diese Art des Lernens bewältigen. Die Forscher stellten fest, dass diese KI-Modelle zwar unglaublich intelligent sind, sie jedoch oft „mentale Abkürzungen" nehmen, die sie schlecht darin machen, später neue Dinge zu lernen.
Hier ist die Aufschlüsselung ihrer Erkenntnisse unter Verwendung einfacher Analogien:
1. Die zwei Arten von Lernenden
Die Forscher testeten zwei Modelle:
- BERT: Denken Sie daran wie an einen Fotografen. Er betrachtet ein ganzes Bild auf einmal und versucht, die spezifischen Details dieses einzelnen Bildes auswendig zu lernen. Er ist sehr schnell und gut darin, Muster im Moment zu erkennen, versteht aber nicht wirklich den Prozess, wie das Bild entstanden ist.
- ALBERT: Denken Sie daran wie an einen Programmierer. Anstatt nur das Bild auswendig zu lernen, lernt er eine Reihe von Anweisungen (wie eine Schleife in einem Computercode), die wiederholt werden können, um das Problem zu lösen. Er versteht den Mechanismus hinter dem Rätsel.
2. Die Falle der „Abkürzung"
Als die Modelle das erste Rätsel lernten (nennen wir es „Rätsel A"), schnitten beide gut ab. Als die Forscher jedoch „Rätsel B" einführten (das sehr ähnlich, aber leicht anders war), trat ein Problem auf.
BERT (Der Fotograf): Er lernte eine Abkürzung. Er merkte: „Hey, wenn ich mir nur den allerersten Hinweis im Rätsel ansehe, kann ich die Antwort für diese spezifische Art von Rätsel erraten." Er lernte nicht die eigentliche Logik; er memorisierte nur einen Trick, der für Rätsel A funktionierte.
- Das Ergebnis: Als er mit Rätsel B konfrontiert wurde, geriet BERT in Verwirrung. Da er sich auf einen Trick stützte, der spezifisch für Rätsel A war, konnte er sich nicht anpassen. Er vergaß auch völlig, wie man Rätsel A löst, sobald er begann, Rätsel B zu lernen. Dies nennt man katastrophales Vergessen.
ALBERT (Der Programmierer): Er lernte den Algorithmus. Er stellte fest: „Oh, ich muss den aktuellen Zustand nehmen, eine Regel anwenden und zum nächsten Schritt übergehen." Das ist wie das Lernen einer „For-Schleife" (eine Computeranweisung, die eine Aktion wiederholt).
- Das Ergebnis: Da ALBERT die Methode und nicht einen spezifischen Trick lernte, konnte er diese Methode viel schneller auf Rätsel B anwenden. Er zeigte Vorwärtsübertragung, was bedeutet, dass er das in Rätsel A Gelernte nutzte, um das Lernen von Rätsel B zu beschleunigen.
3. Die Größe spielt eine Rolle (aber nicht so, wie Sie denken)
Die Forscher versuchten, die Modelle größer zu machen (indem sie mehr Schichten hinzufügten, wie das Hinzufügen weiterer Räume zu einem Haus).
- Für ALBERT: Größer war besser. Mehr „Räume" bedeuteten, dass er seinen Algorithmus verfeinern und beim Übertragen von Wissen noch besser werden konnte.
- Für BERT: Größer machte die Dinge tatsächlich schlimmer oder instabil. Da BERT sich auf Abkürzungen stützt, gab eine komplexere dem Modell nur mehr Möglichkeiten, in einer schlechten Gewohnheit stecken zu bleiben. Es konnte sein Lernen nicht auf neue Rätsel verallgemeinern.
4. Die „Speicher-Wiedergabe"-Lösung
Beide Modelle litten unter katastrophalem Vergessen – wenn sie das neue Rätsel lernten, löschten sie die Erinnerung an das alte vollständig.
Um dies zu beheben, verwendeten die Forscher einen Wiedergabepuffer. Stellen Sie sich einen Schüler vor, der, während er für einen neuen Mathe-Test lernt, ein paar Lernkarten vom alten Test auf seinem Schreibtisch liegen hat, um gelegentlich einen Blick darauf zu werfen.
- Das Ergebnis: Das wirkte Wunder. Indem man den Modellen während des Lernens der neuen Daten einen winzigen Teil (nur 1 %) der alten Daten zeigte, hörten sie auf zu vergessen. Sowohl BERT als auch ALBERT konnten sich an die alten Rätsel erinnern, während sie die neuen lernten.
5. Die letzte Hürde: Die Rätsel kombinieren
Der ultimative Test für „kompositionelle Schlussfolgerung" ist, ob die KI Regeln aus verschiedenen Rätseln mischen und kombinieren kann, um ein brandneues, komplexes Rätsel zu lösen, das alle vereint.
- Das Problem: Selbst mit der „Wiedergabepuffer"-Hilfe, die ihnen half, sich zu erinnern, hatten beide Modelle Schwierigkeiten, die Regeln zu kombinieren. Sie konnten sich an Rätsel A und Rätsel B separat erinnern, aber sie konnten sie nicht leicht zu einem hybriden Rätsel verweben, um es zu lösen.
- Der Unterschied: Die Forscher fanden einen Weg, ALBERT dabei zu helfen, dies zu meistern. Wenn sie ALBERT mit einer Strategie unterrichteten, bei der sie die alten und neuen Rätsel während des Trainings langsam zusammennähten (anstatt sie getrennt zu halten), konnte ALBERT lernen, sie zu kombinieren.
- Die Grenze: Diese „Zusammennäh"-Strategie funktionierte nicht für BERT. Da BERT sich während des anfänglichen Trainings bereits in seiner „Abkürzungs"-Denkweise festgefahren hatte, konnte es später nicht dazu gebracht werden, die Regeln zu kombinieren. Es war zu sehr in seinen Mustern verankert.
Das Fazit
Die Studie kommt zu dem Schluss, dass KI-Modelle wie BERT und ALBERT zwar mächtig sind, aber einen versteckten Fehler haben: Sie neigen dazu, „Abkürzungen" (Cheat-Codes) zu lernen, anstatt tiefe Logik.
- ALBERT ist besser darin, die tiefe Logik (die „For-Schleife") zu lernen, was ihm hilft, neue, verwandte Aufgaben schneller zu lernen.
- BERT bleibt an oberflächlichen Tricks hängen, was ihn schlecht darin macht, sich an neue Situationen anzupassen, und dazu führt, dass er alte vergisst.
Die Studie legt nahe, dass wir, um KI wirklich fähig zum kontinuierlichen Lernen (unbegrenzt lernen, ohne zu vergessen) zu machen, weg von Modellen gehen müssen, die sich auf Abkürzungen verlassen, und hin zu Architekturen, die darauf ausgelegt sind, die zugrunde liegenden „Algorithmen" der Welt zu verstehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.