Do we carry the false belief that LLMs have a theory of mind?
Obwohl große Sprachmodelle oft hohe Punktzahlen in Assessments zur Theorie des Geistes erzielen, zeigt diese Studie, dass sie sich auf kosteneffiziente Heuristiken anstatt auf eine echte Verfolgung mentaler Zustände verlassen, was darauf hindeutet, dass ihnen robuste Fähigkeiten zur Theorie des Geistes fehlen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Der Mensch besitzt eine einzigartige kognitive Superkraft, die es uns ermöglicht, die soziale Welt zu navigieren: die Fähigkeit zu verstehen, dass andere Menschen eigene Geister besitzen, die mit Gedanken, Überzeugungen und Wünschen gefüllt sind, die sich von unseren eigenen unterscheiden können. Psychologen nennen diese Kapazität „Theory of Mind“ (Theory of Mind). Es ist der mentale Mechanismus, der uns erkennen lässt, dass ein Freund vielleicht an einem Ort nach etwas sucht, an dem er es zuletzt gesehen hat, auch wenn wir wissen, dass der Gegenstand inzwischen an einen anderen Ort bewegt wurde. Diese Fähigkeit handelt nicht nur von Klugheit; sie ist das Fundament von Empathie, Kommunikation und Kooperation. Seit Jahrzehnten nutzen Forscher eine einfache Geschichte, die oft zwei Charaktere namens Sally und Anne beinhaltet, um zu testen, ob Kinder diese Fähigkeit entwickelt haben. In der Geschichte versteckt Sally ein Spielzeug in einem Korb und verlässt den Raum. Während sie weg ist, bewegt Anne das Spielzeug in eine Box. Wenn Sally zurückkehrt, ist die Frage simpel: Wo wird sie nach ihrem Spielzeug suchen? Ein Kind mit einer entwickelten Theory of Mind weiß, dass Sally im Korb suchen wird, weil dies der Ort ist, an dem sie glaubt, dass das Spielzeug sich befindet, ungeachtet der Tatsache, dass es nun in der Box liegt.
Kürzlich ist eine neue Art von Intelligenz in unserem täglichen Leben entstanden: große Sprachmodelle. Dies sind Computerprogramme, die auf riesigen Mengen an Text trainiert wurden und Texte schreiben, chatten und Probleme lösen können, mit einer Flüssigkeit, die oft menschliche Konversation imitiert. Da diese Modelle komplexe Themen diskutieren und Kontext zu verstehen scheinen, haben viele Forscher und Beobachter begonnen, sich zu fragen, ob auch sie eine Theory of Mind besitzen. Wenn eine Maschine korrekt vorhersagen kann, was eine fiktive Figur glaubt, versteht sie dann wirklich das Konzept des Glaubens oder rät sie lediglich basierend auf Mustern, die sie zuvor gesehen hat? Diese Frage ist dringlich geworden, da diese Werkzeuge immer stärker in unser soziales und berufliches Leben integriert werden, was die Notwendigkeit unterstreicht, zu bestimmen, ob sie echte soziale Partner oder nur sehr ausgeklügelte Mimikry sind.
Eine aktuelle Studie setzte sich zum Ziel, diese Frage zu beantworten, indem sie fünf der fortschrittlichsten Sprachmodelle mithilfe des klassischen Sally-Anne-Szenarios und mehrerer Variationen davon testete. Die Forscher unter der Leitung von Nicholas Griffen von der Université Paris Cité fragten die Modelle nicht einfach die Standardfrage. Stattdessen entwarfen sie eine Reihe von Herausforderungen, um zu sehen, ob die Modelle in der Lage sind, die subtilen Details der Geschichte zu bewältigen, die echtes Denken statt bloßer Auswendiglernen erfordern. Sie testeten Modelle führender Unternehmen, darunter GPT-5.5 Luna, Claude Sonso 5, Gemini 3.1 Pro, Grok 4.5 und Mistral Medium 3.5. Um sicherzustellen, dass die Ergebnisse fair waren, erstellten die Forscher neue, einzigartige Versionen der Geschichte für jeden Test, wobei sie Namen, Objekte und spezifische Details änderten, damit die Modelle nicht einfach eine frühere Antwort aus ihren Trainingsdaten abrufen konnten. Sie führten auch knifflige Wendungen ein, wie etwa transparente Behälter, sodass die Charaktere das Spielzeug sehen konnten, oder änderten die Wörter, die verwendet wurden, um zu beschreiben, wo das Spielzeug platziert wurde, um zu sehen, ob die Modelle ihr Denken basierend auf neuen visuellen oder linguistischen Informationen anpassen konnten.
Die Ergebnisse zeichneten das Bild eines Systems, das in einigen Bereichen hochgradig fähig, in anderen jedoch fundamental begrenzt ist. Wenn die Modelle mit der Standardversion der Geschichte konfrontiert wurden, schnitten sie bemerkenswert gut ab, wobei die meisten fast jedes Mal korrekt antworteten. Tatsächlich erzielten sie im Durchschnitt über alle verschiedenen Arten von Fragen hinweg Werte, die weit über dem lagen, was durch Zufall zu erwarten gewesen wäre. Der beste Performer, Gemini 3.1 Pro, lieferte insgesamt in 84 Prozent der Fälle die richtige Antwort. Dieser Erfolg deutet darauf hin, dass diese Modelle das allgemeine Muster der „False Belief“-Aufgabe (Irrtumsaufgabe) aus der riesigen Menge an Texten, die sie gelesen haben, gelernt haben. Sie können die Struktur der Geschichte erkennen und die Antwort liefern, die ein Mensch in einem Lehrbuchszenario geben würde.
Dennoch zeigte die Studie, dass dieser Erfolg fragil ist. Als die Forscher Variationen einführten, die erforderten, dass die Modelle gesunden Menschenverstand anwenden oder visuelle Informationen integrieren, sank die Leistung dramatisch. In einer Variation wurde die Geschichte so beschrieben, dass die Behälter transparent waren, was bedeutete, dass der Charakter, der in den Raum zurückkehrte, das Spielzeug tatsächlich an seinem neuen Standort sehen konnte. In einer realen Situation würde ein Mensch verstehen, dass die Person, da sie das Spielzeug sehen kann, keinen falschen Glauben mehr hegt; sie kennt die Wahrheit. Die Modelle hingegen scheiterten weitgehend daran, diese Verbindung herzustellen. Nur ein Modell, Gemini 3.1 Pro, schaffte es, mehr als die Hälfte dieser Antworten korrekt zu beantworten. Die anderen bestanden weiterhin darauf, dass der Charakter am alten, leeren Ort suchen würde, und ignorierten dabei, dass der Charakter das Spielzeug sehen konnte.
Die Schwierigkeit wurde noch ausgeprägter, als die Forscher die Präpositionen änderten, die den Standort des Spielzeugs beschrieben. In der Standardgeschichte wird ein Spielzeug „in“ eine Box gelegt. Im Test beschrieben die Forscher das Spielzeug als „auf“ einer Box oder „unter“ einem Eimer platziert. Wenn die Geschichte implizierte, dass das Spielzeug sichtbar war, weil es oben auf einem Behälter lag, anstatt darin verborgen zu sein, versagten sämtliche Modelle vollständig und erreichten bei diesen Fragen null Prozent. Sie konnten nicht schlussfolgern, dass die Sichtbarkeit des Objekts den Geisteszustand des Charakters veränderte. Ähnlich verhielt es sich, wenn die Geschichte einen Charakter beinhaltete, dem explizit gesagt wurde, wohin das Spielzeug bewegt wurde, oder wenn die Frage darauf abzielte, was ein Charakter dachte, was ein anderer tun würde; die Modelle gerieten ins Straucheln. Sie griffen oft auf einfache, starre Muster zurück, anstatt die mentalen Zustände der Charaktere dynamisch während des Verlaufs der Geschichte zu verfolgen.
Die Forscher untersuchten auch, wie die Modelle mit dem Geschlecht der Charaktere umgingen. Sie fanden heraus, dass die Modelle etwas besser abschnitten, wenn die beiden Charaktere der Geschichte dasselbe Geschlecht hatten, und etwas schlechter, wenn sie unterschiedliche Geschlechter hatten. Dies deutet darauf hin, dass die Modelle das Geschlecht als Abkürzung verwenden, um zu verfolgen, wer wer ist, anstatt die Rollen und Handlungen jedes Individuums wirklich zu verstehen. Wenn diese Abkürzung durch die Verwendung zweier Charaktere desselben Geschlechts entfernt wurde, schienen sie sich stärker auf die Abfolge der Ereignisse zu verlassen, was paradoxerweise dazu führte, dass sie die Antwort häufiger richtig bekamen. Dies deutet darauf hin, dass ihr Denken nicht so robust ist wie menschliches Denken, welches nicht auf solche oberflächlichen Merkmale angewiesen ist, um eine Situation zu verstehen.
Das Kernergebnis der Studie ist, dass diese Sprachmodelle zwar die korrekten Antworten auf Theory-of-Mind-Tests imitieren können, aber nicht die zugrunde liegende Fähigkeit zu besitzen scheinen, mentale Zustände so zu verstehen, wie es Menschen tun. Sie haben Schwierigkeiten, die Verbindung zwischen dem, was ein Charakter sieht, was er weiß und was er glaubt, herzustellen. Die Modelle scheinen „Heuristiken“ oder mentale Abkürzungen zu verwenden, um die Antwort basierend auf den häufigsten Mustern in ihren Trainingsdaten zu erraten. Wenn die Geschichte vom Standardmuster abwich, indem visuelle Details hinzugefügt oder die räumlichen Beziehungen geändert wurden, versagten die Abkürzungen. Die Forscher legen nahe, dass dies daran liegt, dass die Modelle nur auf Text trainiert wurden. Sie haben nie erlebt, wie ein Spielzeug bewegt wird, nie das Gefühl erlebt, nach etwas zu suchen, und nie darauf angewiesen, ihre eigenen Augen zu benutzen, um ihr Wissen über die Welt zu aktualisieren. Ohne diese verkörperte Erfahrung können sie das Konzept eines Glaubens, der von der Realität abweicht, nicht wahrhaft erfassen.
Letztendlich dient die Studie als Warnung davor, anzunehmen, dass eine Maschine wie ein Mensch denkt, nur weil sie wie ein Mensch sprechen kann. Die Modelle können Antworten produzieren, die so wirken, als hätten sie eine Theory of Mind, aber wenn sie mit Szenarien getestet werden, die ein echtes Verständnis von Wahrnehmung und Glauben erfordern, offenbaren sie ihre Grenzen. Sie sind exzellent darin, das zu wiederholen, was sie gelesen haben, aber sie sind noch nicht in der Lage zu dem flexiblen, gesunden Denken, das es Menschen ermöglicht, die komplexe soziale Welt zu navigieren. Während diese Werkzeuge immer gebräuchlicher werden, ist es wichtig, sich daran zu erinnern, dass ihre scheinbare Intelligenz ein Spiegelbild der Daten ist, die sie konsumiert haben, und kein Zeichen dafür, dass sie einen eigenen Geist entwickelt haben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.