← Neueste Arbeiten
💬 NLP

Probabilistic Attribution For Large Language Models

Dieser Beitrag stellt ein modellagnostisches probabilistisches Attributionsframework vor, das die Bayes-Regel auf Token-Wahrscheinlichkeiten von LLMs anwendet, um die Bedeutung und Entropie von Tokens zu quantifizieren, wodurch die Interpretierbarkeit verbessert und Erkenntnisse über die Stabilität und das Verhalten von Modellen bei verschiedenen Prompts gewonnen werden.

Ursprüngliche Autoren: Shilpika Shilpika, Carlo Graziani, Bethany Lusch, Venkatram Vishwanath, Michael E. Papka

Veröffentlicht 2026-05-22
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Shilpika Shilpika, Carlo Graziani, Bethany Lusch, Venkatram Vishwanath, Michael E. Papka

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Large Language Model (LLM) nicht als magisches Gehirn vor, das wie ein Mensch „denkt", sondern als hochentwickelten Spielautomaten oder als riesigen, hochgeschwindigkeitsfähigen Würfelspieler.

Jedes Mal, wenn das Modell ein Wort (oder ein „Token") schreibt, rät es nicht einfach. Es berechnet die Wahrscheinlichkeiten für jedes mögliche nächste Wort in seinem gesamten Wörterbuch, basierend auf allem, was es bisher geschrieben hat. Es wählt das nächste Wort auf Grundlage dieser Wahrscheinlichkeiten aus.

Diese Arbeit mit dem Titel „Probabilistic Attribution for Large Language Models" stellt eine neue Methode vor, um in diesen Spielautomat zu blicken und zu verstehen, warum er die Wörter gewählt hat, die er gewählt hat. Die Autoren nennen dieses neue Werkzeug den Attribution Score (AS).

Hier ist eine Aufschlüsselung ihrer Ideen unter Verwendung einfacher Analogien:

1. Die Kernidee: Das Band zurückspulen

Normalerweise, wenn wir einer KI eine Frage stellen, gibt sie eine Antwort. Wir könnten uns fragen: „Welcher Teil meiner Frage hat dazu geführt, dass sie das gesagt hat?"

Die Autoren behandeln den Schreibprozess der KI als stochastischen Prozess (ein komplizierter mathematischer Begriff für einen zufälligen Prozess, der sich im Laufe der Zeit entwickelt, wie Wetterphänomene oder Aktienmärkte). Sie erkannten, dass, da die KI lediglich Wahrscheinlichkeiten berechnet, wir Mathematik nutzen können, um das Band „zurückzuspulen".

Die Analogie:
Stellen Sie sich vor, Sie hören ein Lied und möchten wissen, welche spezifische Note in der Melodie dazu geführt hat, dass der Sänger am Ende eine hohe Note traf.

  • Der alte Weg: Sie raten, welche Note wichtig war.
  • Der Weg der Autoren: Sie nehmen das Lied, entfernen eine Note nach der anderen und fragen den Sänger: „Wenn ich diese spezifische Note nicht spielen würde, wie wahrscheinlich wäre es dann noch, dass Sie diese hohe Note treffen?"
    • Wenn das Entfernen der Note die hohe Note unmöglich macht, war diese Note entscheidend (Hoher Score).
    • Wenn das Entfernen der Note nichts verändert, war diese Note nur Hintergrundrauschen (Niedriger Score).

2. Der Zaubertrick: Das „Was-wäre-wenn"-Spiel

Der knifflige Teil ist, dass die KI nur weiß, wie man vorwärts schreibt. Sie kann nicht natürlich sagen: „Was wäre, wenn ich dieses Wort übersprungen hätte?"

Die Autoren verwendeten einen mathematischen Trick (Bayes-Regel), um die KI zu zwingen, dieses „Was-wäre-wenn"-Spiel zu spielen. Sie sagen der KI im Wesentlichen: „Hier ist Ihr Prompt und Ihre Antwort. Stellen Sie sich nun vor, das Wort 'Apfel' in Ihrem Prompt wäre tatsächlich jedes andere Wort im Wörterbuch. Wie verändert das die Wahrscheinlichkeiten Ihrer Antwort?"

Indem sie diese Mathematik durchführen, berechnen sie einen Score für jedes einzelne Wort im Prompt. Dieser Score sagt Ihnen aus, wie stark dieses spezifische Wort die KI zu ihrer endgültigen Antwort „gedrückt" hat.

3. Messen von „Verwirrung" (Entropie)

Die Arbeit betrachtet auch die Entropie, die ein Maß für Unsicherheit oder Verwirrung ist.

Die Analogie:
Stellen Sie sich vor, Sie versuchen, das nächste Wort in einem Satz zu erraten.

  • Niedrige Entropie (Niedrige Verwirrung): Der Satz ist „Der Himmel ist..." Die KI ist zu 99 % sicher, dass das nächste Wort „blau" ist. Sie ist nicht verwirrt.
  • Hohe Entropie (Hohe Verwirrung): Der Satz ist „Das... Ding... tat..." Die KI hat keine Ahnung, was als Nächstes kommt. Es ist ebenso wahrscheinlich, dass es „Katze", „Hund", „laufen" oder „springen" ist.

Die Autoren fanden heraus, dass:

  • Wenn ein Wort einen hohen Attribution Score hat (es ist sehr wichtig), die KI aber dennoch sehr verwirrt ist (hohe Entropie) darüber, womit sie es ersetzen soll, etwas seltsam ist. Dies könnte bedeuten, dass das Modell instabil ist oder die Daten nicht gut gelernt hat.
  • Wenn ein Wort einen niedrigen Score hat (es spielt keine große Rolle) und die KI sehr zuversichtlich ist (niedrige Entropie) darüber, womit sie es ersetzt, ist dieses Wort wahrscheinlich nur „Füllmaterial" oder Rauschen.

4. Was sie entdeckten

Die Autoren testeten dies an 8 verschiedenen KI-Modellen mit 7 verschiedenen Prompts. Hier ist, was sie fanden:

  • Ältere vs. neuere Modelle: Ältere Modelle (wie GPT-2) schienen „verwirrter" zu sein (höhere Entropie), selbst wenn die Wörter nicht wichtig zu sein schienen. Neuere Modelle (wie Llama) waren stabiler und zuversichtlicher. Dies deutet darauf hin, dass die neueren Modelle besser auf ihre Trainingsdaten „konvergiert" sind – sie wissen konsistenter, wovon sie sprechen.
  • Finden der „schlechten" Wörter: Sie fanden spezifische Fälle, in denen die KI verwirrt war. Zum Beispiel bevorzugte die KI in einem Prompt das Wort „in" gegenüber dem Wort „wann" des Benutzers, um den Satzfluss zu verbessern. Der Score enthüllte diese Diskrepanz und zeigte, dass die KI mit einer leicht anderen Frage „glücklicher" war.
  • Token-Sensitivität: Einige Wörter sind wie der „Schlussstein" eines Bogens; wenn man sie entfernt, bricht die gesamte Antwort zusammen. Der Score identifiziert diese Schlussstein-Wörter. Andere Wörter sind wie der Mörtel; man kann sie austauschen, und die Antwort bleibt gleich.

5. Warum dies wichtig ist (laut der Arbeit)

Die Autoren behaupten, diese Methode sei Modellagnostisch.

  • Analogie: Denken Sie an verschiedene KI-Modelle als verschiedene Marken von Autos (Ford, Toyota, Tesla). Die meisten Werkzeuge, um zu erklären, wie sie funktionieren, funktionieren nur bei einer Marke. Dieses neue Werkzeug ist wie ein universeller Diagnose-Scanner, der bei jedem Auto funktioniert, unabhängig davon, wie der Motor gebaut ist.

Sie behaupten auch, es sei Parameterfrei.

  • Analogie: Viele Werkzeuge erfordern, dass Sie Knöpfe und Regler (Einstellungen) drehen, um ein Ergebnis zu erhalten. Wenn Sie den Knopf falsch drehen, ist das Ergebnis Müll. Dieses Werkzeug erfordert keine Knöpfe; es verwendet einfach die Mathematik, die die KI ohnehin bereits durchführt. Dies macht die Ergebnisse objektiver und vertrauenswürdiger.

Zusammenfassung

Die Arbeit präsentiert eine mathematische „Röntgenaufnahme" für die KI-Textgenerierung. Anstatt zu raten, warum eine KI etwas gesagt hat, verwenden sie Wahrscheinlichkeitsmathematik, um genau zu berechnen, wie stark jedes Wort in Ihrer Frage zur Antwort beigetragen hat. Sie nutzen dies, um zu erkennen, welche Modelle stabil sind, welche verwirrt sind und welche Wörter die wahren Treiber des Verhaltens der KI sind.

Wichtiger Hinweis: Die Arbeit konzentriert sich streng auf das Verständnis der Mathematik und Stabilität der Modelle. Sie behauptet nicht, KI-Halluzinationen zu beheben, medizinische Zustände zu diagnostizieren oder Rechtsfälle zu lösen, obwohl sie darauf hindeutet, dass das Verständnis dieser Wahrscheinlichkeiten den Nutzern hilft, sich auf die „unsicheren oder instabilen" Teile der Generierung einer KI zu konzentrieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →