Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
Diese Arbeit untersucht, ob LLaMA 2 und Flan-T5 über echtes transitives Denken verfügen oder sich auf oberflächliche Hinweise verlassen, indem sie Wortüberschneidungen, vortrainiertes Wissen und benannte Entitäten kontrolliert, wobei sich zeigt, dass beide Modelle zwar lexikalische Überschneidungen nutzen, Flan-T5 jedoch eine größere Resilienz gegenüber wissensbasierten Manipulationen aufweist, was auf eine potenzielle Rolle des Fine-Tunings bei der Entwicklung logischen Verständnisses hindeutet.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In dem sich schnell entwickelnden Feld der künstlichen Intelligenz hat ein spezieller Typ von Computerprogrammen, bekannt als Large Language Model (Großes Sprachmodell), die Weltöffentlichkeit gefesselt. Diese Systeme, die auf riesigen Mengen an Text aus dem Internet trainiert wurden, können Geschichten schreiben, Sprachen übersetzen und komplexe Fragen beantworten. Eine zentrale Frage für Wissenschaftler, die diese Maschinen untersuchen, ist, ob sie wirklich Logik verstehen oder ob sie lediglich die Muster nachahmen, die sie zuvor gesehen haben. Um dies zu testen, suchen Forscher nach einer grundlegenden Fähigkeit namens transitiver Schlussfolgerung (transitive reasoning). In Alltagstermen ausgedrückt ist dies die Fähigkeit, zwei separate Informationen miteinander zu verknüpfen, um zu einem neuen Schluss zu gelangen. Wenn zum Beispiel eine Person weiß, dass eine Katze eine Art von Tier ist und dass alle Tiere Nahrung benötigen, kann sie logisch schlussfolgern, dass eine Katze Nahrung benötigt, ohne dass ihr diese spezifische Tatsache explizit mitgeteilt wurde. Dieser Prozess erfordert mehr als nur Gedächtnis; er verlangt die Fähigkeit, Fakten miteinander zu verweben. Die Frage, die die jüngste Forschung antreibt, ist, ob diese leistungsstarken Computerprogramme tatsächlich diese mentale Verwebung durchführen oder ob sie eine Abkürzung nehmen, indem sie bekannte Wörter erkennen und die Antwort erraten.
Ein Team von Forschern der Heriot-Watt University und der University of Edinburgh machte sich daran, genau dieses Problem zu untersuchen. Sie konzentrierten sich auf zwei unterschiedliche Arten von Sprachmodellen, eines namens LLaMA 2 und ein anderes namens Flan-T5, um zu sehen, wie sie mit Fragen umgingen, die das Verknüpfen zweier Fakten erforderten. Die Wissenschaftler verwendeten zwei bestehende Sammlungen von Fragen, die darauf ausgelegt waren, diese Art des Denkens zu testen. Eine Sammlung, bekannt als QASC, präsentiert Multiple-Choice-Fragen über die Wissenschaft, die das Kombinieren zweier Aussagen erfordern, um die richtige Antwort zu finden. Die andere Sammlung, genannt Bamboogle, enthält Fragen, die knifflig genug sind, dass eine Standard-Suchmaschine im Internet sie falsch beantworten könnte, was das Modell dazu zwingt, auf seine eigene Verarbeitung zurückzugreifen. Die Forscher wollten wissen, ob die Modelle tatsächlich durch die Schritte logisch schlussfolgerten oder ob sie sich einfach an spezifische Wörter hefteten, wie etwa Daten oder Namen, die sowohl in der Frage als auch in der Antwort vorkamen.
Um der Wahrheit auf den Grund zu gehen, entwarf das Team eine Reihe kluger Experimente, bei denen die Informationen, die den Modellen gegeben wurden, systematisch verändert wurden. Sie begannen damit zu prüfen, ob die Modelle die Probleme lösen konnten, wenn ihnen die Fakten und ein klares Beispiel dafür gegeben wurden, wie man sie miteinander verknüpft. Beide Modelle schnitten unter diesen Bedingungen gut ab, aber die Forscher vermuteten, dass dies zu einfach sei. Sie entfernten dann das Beispiel für die Verknüpfung der Fakten, sodass die Modelle die Verbindung selbst herausfinden mussten. Die Ergebnisse waren aufschlussreich. Das Flan-T5-Modell, das speziell auf ähnliche Denkaufgaben trainiert worden war, konnte selbst ohne das Beispiel weiterhin sehr gut abschneiden. Das LLaMA 2-Modell hingegen hatte ohne diese Anleitung erhebliche Schwierigkeiten, was darauf hindeutete, dass es stark darauf angewiesen war, das Muster des Denkens zu sehen, bevor es diesem folgen konnte.
Die Forscher gingen dann eine drastischere Methode vor, um zu sehen, ob die Modelle die Bedeutung der Wörter wirklich verstanden. Sie vertauschten die Reihenfolge der Wörter innerhalb der Fakten und verwandelten klare Sätze in wirre, unsinnige Textketten. Wenn die Modelle wirklich über die Bedeutung der Sätze schlussfolgern würden, sollte dieses Chaos die Beantwortung der Fragen unmöglich gemacht haben. Überraschenderweise sank die Leistung der Modelle kaum. Sie waren immer noch in der Lage, die richtige Antwort zu wählen, selbst wenn die Sätze keinen grammatikalischen Sinn ergaben. Dies deutete darauf hin, dass die Modelle die Sätze nicht als kohärente Gedanken lasen. Stattdessen scannten sie wahrscheinlich nach spezifischen Schlüsselwörtern, die mit den Antwortmöglichkeiten übereinstimmten. Als die Forscher diese passenden Schlüsselwörter vollständig entfernten, brach die Genauigkeit der Modelle drastisch ein, was bestätigte, dass sie oft nur Wörter abglichen, anstatt Logik abzuleiten.
Um die Möglichkeit auszuschließen, dass die Modelle lediglich die Antworten aus ihren Trainingsdaten auswendig gelernt hatten, wandte das Team den Bamboogle-Datensatz an, der Fragen enthielt, die die Modelle noch nie zuvor gesehen hatten. Hier führten sie einen letzten, strengen Test ein. Sie ersetzten die Namen von Personen, Orten und Daten – die spezifischen Entitäten, die oft in den Antworten erscheinen – durch Nonsens-Wörter. Sie vertauschten zudem die Reihenfolge der Wörter in den Fakten. Als die Modelle mit diesen unsinnigen Versionen konfrontiert wurden, versagte das LLaMA 2-Modell fast vollständig. Es konnte die Antwort nicht finden, ohne die vertrauten Namen und Daten zur Orientierung zu haben. Das Flan-T5-Modell hingegen zeigte eine andere Art von Resilienz. Obwohl seine Leistung sank, blieb es signifikant besser als das andere Modell. Dies deutet darauf hin, dass Flan-T5, weil es explizit auf Denkaufgaben trainiert wurde, eine robustere Fähigkeit entwickelt hatte, der logischen Kette zu folgen, selbst wenn die vertrauten Hinweise entfernt wurden.
Die Studie kommt zu dem Schluss, dass, obwohl große Sprachmodelle den Anschein erwecken können zu denken, ihr Erfolg oft von der spezifischen Art und Weise abhängt, wie sie trainiert wurden und welche Hinweise im Text verfügbar sind. Für Modelle, die nicht speziell auf Denkaufgaben feinabgestimmt wurden, scheint die Fähigkeit, komplexe Fragen zu beantworten, stark auf dem Erkennen bekannter Wörter und Muster zu beruhen, anstatt auf echter logischer Deduktion. Selbst wenn sie scheinbar Schritt für Schritt denken, führen sie möglicherweise lediglich die richtigen Schlüsselwörter auf. Die Forschung legt jedoch nahe, dass ein Modell, wenn es sorgfältig mit Datensätzen trainiert wird, die darauf ausgelegt sind, ihm das Verknüpfen von Fakten beizubringen, eine eher echte Kapazität für transitive Schlussfolgerung entwickeln kann. Diese Kapazität ermöglicht es ihm, Fragen zu bewältigen, selbst wenn die üblichen Abkürzungen, wie erkennbare Namen oder Daten, entfernt werden. Die Ergebnisse dienen als Erinnerung daran, dass hohe Punktzahlen in Denktests nicht immer beweisen, dass eine Maschine Logik versteht; manchmal ist sie einfach nur sehr gut darin, die richtigen Wörter zu finden.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.