← Neueste Arbeiten
💬 NLP

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

Diese Arbeit zeigt auf, dass lexikalische Perturbationen das logische Denken von LLMs massiv verschlechtern, indem sie die Tokenisierung fragmentieren und die Aufmerksamkeit in den Transformer-Schichten ablenken – ein gekoppelter Effekt, der Reparaturstrategien zur Laufzeit unwirksam macht, da diese daran scheitern, gleichzeitig sowohl den korrumpierten Inhalt als auch die Aufmerksamkeitsallokation wiederherzustellen.

Ursprüngliche Autoren: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

Veröffentlicht 2026-08-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Große Sprachmodelle sind die Motoren einer neuen Generation künstlicher Intelligenz, die in der Lage sind, komplexe Anweisungen zu lesen, mathematische Probleme zu lösen und Gespräche zu führen, die bemerkenswert menschlich wirken. Diese Systeme arbeiten, indem sie Text in kleine Stücke zerlegen, sogenannte Token, die als Bausteine dienen, damit das Modell Bedeutung verstehen kann. Wenn ein Mensch einen Satz mit einem Tippfehler liest, überspringt das Gehirn den Fehler mühelos und erfasst die beabsichtigte Botschaft. Jahrelang nahmen Forscher an, dass diese leistungsstarken Computermodelle dieselbe Resilienz besitzen würden, und glaubten, dass geringfügige Rechtschreibfehler oder unbeholle Formulierungen ihre Fähigkeit zu logischem Denken nicht signifikant beeinträchtigen würden. Die Frage, wie fragil diese Systeme angesichts realistischer, alltäglicher Fehler tatsächlich sind, blieb weitgehend unbeantwortet und hinterließ eine Lücke zwischen ihrer beeindruckenden Leistung bei sauberen Daten und ihrer Zuverlässigkeit in der unordentlichen, realen Welt.

Eine aktuelle Studie setzte sich zum Ziel, diese Lücke zu schließen, indem sie testete, wie vier verschiedene große Sprachmodelle mit drei spezifischen Arten von Textkorruption umgehen. Die Forscher nahmen Standard-Aufgaben des logischen Denkens, wie etwa das Beantworten von Fragen zur physikalischen Wissenschaft oder das Lösen mehrstufiger mathematischer Probleme, und führten realistische Fehler ein. Sie simulierten schnelle Tippfehler, bei denen eine Taste neben der beabsichtigten getroffen wird, vertauschte benachbarte Buchstaben innerhalb eines Wortes und fügten Gesprächsfüllsel wie „äh“ oder „weißt du“ hinzu, um die Sätze zu verlängern. Das Ziel war es zu sehen, ob die Modelle immer noch die richtige Antwort finden könnten, wenn der Text leicht beschädigt aussah, und um zu verstehen, warum sie genau scheitern könnten.

Die Ergebnisse zeigten eine scharfe und überraschende Kluft in der Reaktion der Modelle. Wenn die Forscher Gesprächsfüllsel hinzufügten, verhielten sich die Modelle fast exakt so wie bei sauberem Text, obwohl die Sätze länger wurden. Wenn sie jedoch Zeichenfehler wie Tippfehler oder vertauschte Buchstaben einführten, stürzte die Genauigkeit der Modelle drastisch ab. Dieser Rückgang war am schwersten bei Aufgaben, die mehrstufiges mathematisches Denken erforderten, wo ein einziger Tippfehler dazu führen konnte, dass das Modell völlig den Faden verlor. Die Studie zeigte, dass das Scheitern nicht durch die zusätzliche Länge des Textes verursacht wurde, sondern durch die spezifische Art und Weise, wie der Computer die Wörter in Stücke zerlegt. Wenn ein Wort falsch geschrieben ist, kann das interne Wörterbuch des Computers es nicht mehr als eine einzige Einheit erkennen. Stattdessen zerlegt es das Wort in seltsame, unbekannte Fragmente.

Die Forscher führten die Ursache dieses Scheiterns auf ein Phänomen zurück, das sie „Aufmerksamkeitsablenkung“ (attention diversion) nennen. In einem funktionierenden Modell konzentriert das System seine Rechenenergie auf die wichtigsten Teile eines Satzes, wie zum Beispiel die Zahlen in einer mathematischen Aufgabe oder die Schlüsselfakten in einer Geschichte. Wenn ein Wort in seltsame Fragmente zerlegt wird, wirken diese Fragmente wie ein Magnet, der die Aufmerksamkeit des Modells von den wichtigen Beweisen weg und hin zu den kaputten Teilen des Textes zieht. Das Modell starrt am Ende auf den Tippfehler anstatt auf die Lösung. Diese Ablenkung ist besonders schädlich in der Mitte und in den Endstadien der Verarbeitung des Modells, wenn es versucht, Informationen zu kombinieren, um eine Antwort zu bilden. Die Studie bestätigte, dass es die Fragmentierung des Wortes ist, nicht die Länge des Satzes, die diesen Fokusverlust vorantreibt.

Um zu verstehen, warum dies so schwer zu beheben ist, führten die Forscher eine Reihe von Experimenten durch, bei denen sie versuchten, das Problem isoliert zu reparieren. Sie versuchten, die Aufmerksamkeit des Modells wieder auf die korrekten Teile des Satzes zu lenken, während die Tippfehler bestehen blieben, und sie versuchten, die Tippfehler zu korrigieren, während der Fokus des Modells verwirrt blieb. Keiner dieser Ansätze funktionierte allein gut. Tatsächlich machte die Korrektur des Fokus, während der Text beschädigt blieb, die Leistung des Modells sogar schlechter, da es nun intensiv auf die falschen Informationen blickte. Die Studie fand heraus, dass die Beschädigung des Textes und die Ablenkung des Modells tief miteinander verknüpft sind; sie können nicht voneinander getrennt werden. Das Modell verlässt sich auf die spezifische Gestalt der Wörter, um die Eingabe zu verstehen, und wenn diese Gestalt gebrochen ist, wird die Aufmerksamkeit des Modells mit ihr mitgerissen.

Diese Kopplung erklärt, warum gängige Strategien zur Leistungsverbesserung, wie etwa das Auffordern des Modells, „Schritt für Schritt zu denken“, oder die Verwendung eines Rechtschreibprüfers vor der eigentlichen Aufgabe, oft scheitern, den Verlust an Genauigkeit auszugleichen. Diese Methoden versuchen meist nur eine Seite des Problems zu beheben – entweder den Text oder den Fokus –, während die andere Seite beschädigt bleibt. Die Forscher entdeckten auch, dass die Schwere des Scheiterns davon abhängt, welche Art von Information korrumpiert wurde. Wenn ein Tippfehler eine Zahl in einer mathematischen Aufgabe trifft, wird das Modell mit Sicherheit scheitern, da diese Zahl aus dem Kontext nicht erraten werden kann. Wenn ein Tippfehler ein häufiges Wort trifft, kann das Modell sich möglicherweise erholen. Dies deutet darauf hin, dass die kritischsten Fehler diejenigen sind, die einzigartige, unersetzliche Informationsteilchen zerstören.

Letztendlich kommt die Studie zu dem Schluss, dass die Verwundbarkeit dieser Modelle in der Art und Weise liegt, wie sie Text ganz zu Beginn ihrer Verarbeitung repräsentieren. Sobald ein Wort in unbekannte Fragmente zerlegt wurde, ist der Schaden ohne Zugang zum ursprünglichen, korrekten Text praktisch irreversibel. Die Forscher fanden heraus, dass selbst ein leistungsfähiges Reparaturmodell die Fehler nicht zuverlässig beheben konnte, da der korrumpierte Text oft keine Hinweise darauf enthielt, was das ursprüngliche Wort gewesen sein könnte. Dies bedeutet, dass der Aufbau wirklich robuster künstlicher Intelligenz darin besteht, den Text zu schützen, bevor er das Modell erreicht, anstatt zu versuchen, ihn im Nachhinein zu reparieren. Die Ergebnisse legen nahe, dass zukünftige Verbesserungen darauf abzielen müssen, das initiale Textverständnis des Systems flexibler zu gestalten, damit es Bedeutung erkennen kann, selbst wenn die Oberflächenform leicht beschädigt ist, anstatt auf perfekte Rechtschreibung angewiesen zu sein, um zu funktionieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →