← Neueste Arbeiten
🤖 machine learning

Language models suffer from a curse of ambiguity

Diese Arbeit identifiziert und analysiert theoretisch einen „Fluch der Ambiguität“ in großen Sprachmodellen und zeigt auf, dass ambivalente Next-Token-Verteilungen aufgrund erhöhter Kapazitätsanforderungen, Einbettungsgrößen, Trainingsschritte und verstärktem Sampling-Rauschen von Natur aus schwieriger präzise zu erlernen sind, eine Erkenntnis, die durch sowohl synthetische als auch reale Experimente validiert wurde.

Ursprüngliche Autoren: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

Veröffentlicht 2026-08-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne Computer, die schreiben und sprechen können, basieren auf einer einfachen, kraftvollen Idee: Sie sagen das nächste Wort in einem Satz voraus, indem sie sich die Wörter ansehen, die zuvor kamen. Dieser Prozess geschieht Wort für Wort, wie ein Mensch, der über eine Geschichte nachdenkt und den wahrscheinlichsten nächsten Schritt wählt, basierend auf dem, was bereits gesagt wurde. Jahrelang haben Ingenieure sich darauf konzentriert, diese Maschinen besser darin zu machen, die einzelne, offensichtlichste Antwort zu finden. Doch während diese Systeme immer fortschrittlicher werden, wird von ihnen zunehmend verlangt, Situationen zu bewältigen, in denen es keine einzige offensichtliche Antwort gibt. Wenn ein Satz auf viele verschiedene, gleichermaßen plausible Arten enden kann, muss die Maschine lernen, ihr Vertrauen über all diese Möglichkeiten zu verteilen, anstatt nur die oberste zu wählen. Diese Fähigkeit, Unsicherheit zu verstehen, wird immer wichtiger, insbesondere da diese Maschinen beginnen, die Trainingsdaten für ihre eigenen zukünftigen Versionen zu schreiben. Wenn sie es versäumen, das volle Spektrum der Möglichkeiten zu erfassen, riskieren sie, eine enge, repetitive Schleife zu erzeugen, die die Qualität ihres eigenen Lernens verschlechtert.

Ein Team von Forschern der Stanford University hat eine fundamentale Barriere entdeckt, die diese Aufgabe überraschend schwierig macht. Sie fanden heraus, dass es für die Maschine umso schwieriger ist, die korrekte Wahrscheinlichkeitsverteilung zu erlernen, je ambivalenter eine Situation ist – das heißt, je mehr plausible nächste Wörter es gibt. Sie nennen dies den „Fluch der Ambiguität“ (Curse of Ambiguity). Es handelt sich nicht bloß darum, dass die Maschine etwas langsamer ist oder mehr Daten benötigt; die Schwierigkeit ist in die Architektur der neuronalen Netze eingebettet, die diese Modelle antreiben. Die Forscher zeigten, dass mit steigender Anzahl möglicher korrekter Antworten die Maschine signifikant mehr internen Speicherplatz, größere interne Repräsentationen von Wörtern und viele mehr Trainingsschritte benötigt, um die Mathematik korrekt abzubilden. Selbst wenn die Maschine es schließlich lernt, führt der Prozess, ein einzelnes Wort aus den vielen Möglichkeiten auszuwählen, eine Art von Rauschen ein, das verhindert, dass sie jemals die wahre Verteilung der Sprache perfekt erreicht.

Um zu verstehen, warum dies geschieht, zerlegte das Team das Problem in seine kleinsten Bestandteile. Sie behandelten die finale Entscheidungsebene der Maschine als einen einfachen Klassifikator, der einen Kontext auf eine Menge möglicher Ergebnisse abbildet. In ihren Experimenten erstellten sie synthetische Aufgaben, bei denen sie die exakte Grundwahrheit kannten: Eine spezifische Anzahl von Wörtern war gleichermaßen wahrscheinlich, einem gegebenen Satz zu folgen. Sie fanden heraus, dass das Speichern eines Musters mit zehn möglichen Ergebnissen etwa zehnmal mehr Kapazität erforderte als das Speichern eines Musters mit nur einem. Es ist, als müsste die Maschine für jede mögliche Option, die sie sich merken muss, einen separaten, distinkten Pfad aufbauen. Darüber hinaus entdeckten sie, dass das interne „Vokabular“, das die Maschine verwendet, um diese Kontexte zu halten, an Größe wachsen muss, um die Ambiguität aufzunehmen. Wenn die Maschine versucht, eine Situation mit vielen gültigen Endungen mit einer Repräsentation darzustellen, die zu klein ist, kann sie schlichtweg nicht zwischen den Optionen unterscheiden, egal wie viel sie trainiert.

Die Schwierigkeit erstreckt sich über die reine Speicherung hinaus. Die Forscher analysierten auch, wie die Maschine im Laufe der Zeit lernt. Sie fanden heraus, dass der Lernprozess wesentlich langsamer beginnt, wenn eine Situation viele mögliche Ausgänge hat. Da die Maschine jedes spezifische korrekte Wort seltener sieht, wenn es so viele davon gibt, ist das Signal, das sie erhält, um ihre internen Einstellungen anzupassen, schwächer. Das bedeutet, dass es länger dauert, bis Fortschritte erzielt werden. Noch schlimmer ist, dass der Akt des Trainings an realen Daten, bei dem die Maschine zu jedem Zeitpunkt nur ein zufälliges Beispiel des korrekten nächsten Wortes sieht, einen anhaltenden Fehler einführt. Wenn das Ziel ein einzelnes, bestimmtes Wort ist, kann die Maschine dies schließlich perfekt lernen. Aber wenn das Ziel eine Verteilung vieler Wörter ist, erzeugt die Zufälligkeit, bei jedem Schritt nur ein einziges Beispiel zu sehen, eine Fehlerschwelle, die die Maschine nicht überwinden kann. Unabhängig davon, wie lange sie trainiert, wird sie immer leicht daneben liegen und nicht in der Lage sein, die wahre Verteilung der Wahrscheinlichkeiten perfekt zu replizieren.

Das Team bestätigte diese Ergebnisse nicht nur in ihren kontrollierten, synthetischen Tests, sondern auch in großen Sprachmodellen, die mit realweltlichen Texten trainiert wurden. Durch die Analyse der Leistung dieser Modelle auf tatsächlichen Daten beobachteten sie dieselben Signaturen: Mit zunehmender Ambiguität eines Kontexts wurden die Vorhersagen des Modells ungenauer, und es neigte dazu, Wahrscheinlichkeitsmasse auf Wörter zu „leaken“, die dort nicht hingehören. Dies deutet darauf hin, dass der Fluch der Ambiguität eine universelle Eigenschaft dieser Systeme ist, die alles von kleinen experimentellen Modellen bis hin zu den massiven, Billionen-Parameter-Systemen beeinflusst, die heute verwendet werden. Die Forscher argumentieren, dass diese Einschränkung kein Fehler ist, der mit einem einfachen Software-Update behoben werden kann, sondern eine fundamentale Beschränkung der Art und Weise, wie diese Netzwerke Unsicherheit repräsentieren.

Diese Entdeckung verändert die Art und Weise, wie wir über die Fähigkeiten künstlicher Intelligenz denken sollten. Sie legt nahe, dass die Skalierung der Größe dieser Modelle zwar hilft, aber das Kernproblem der Ambiguität nicht löst. Selbst die größten Modelle werden immer Schwierigkeiten haben, Situationen mit vielen plausiblen Ausgängen perfekt zu modellieren, wodurch ein Restanteil der Wahrheit ungelernt bleibt. Dies hat praktische Auswirkungen darauf, wie wir diesen Systemen vertrauen. In Bereichen, in denen Präzision entscheidend ist, wie etwa bei medizinischen Diagnosen oder juristischer Argumentation, müssen wir uns bewusst sein, dass die Konfidenzverteilung des Modells inhärent verrauscht sein kann, wenn die Antwort nicht eindeutig ist. Die Arbeit liefert einen neuen Rahmen, um zu verstehen, wann wir einem Output einer Maschine vertrauen können und wann dessen Unsicherheit ein Zeichen einer tieferen strukturellen Limitation ist und nicht bloß eines Mangels an Daten. Letztlich zeigt die Arbeit auf, dass genau das, was die menschliche Sprache reich und flexibel macht – die Fähigkeit, vieles auf viele verschiedene Arten zu sagen – auch das ist, was sie für eine Maschine am schwierigsten zu lernen macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →