← Neueste Arbeiten
🤖 machine learning

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

Dieser Beitrag stellt einfache, skalierbare Techniken vor, um nachzuweisen, dass implizite Planung – ein Mechanismus, bei dem Sprachmodelle mittlere Token auf zukünftige Ziele wie Reime oder Antworten ausrichten – eine universelle Fähigkeit ist, die selbst in Modellen mit nur einer Milliarde Parametern vorhanden ist, und damit neue Erkenntnisse für die KI-Sicherheit und -Kontrolle liefert.

Ursprüngliche Autoren: Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

Veröffentlicht 2026-05-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie beobachten einen Zauberer, der ein Kaninchen aus einem Hut zieht. Sie könnten sich fragen: Hat der Zauberer tatsächlich geplant, ein Kaninchen herauszuholen, bevor er überhaupt mit dem Trick begann, oder entschied er sich erst im Moment, als er in den Hut griff, magisch dafür, ein Kaninchen herauszuholen?

Lange Zeit glaubten Wissenschaftler, dass Large Language Models (LLMs) – die KI-Gehirne hinter Tools wie Chatbots – genau wie Zauberer waren, die nicht vorausplanten. Sie waren der Ansicht, die KI sage einfach das nächste Wort basierend auf dem vorherigen voraus, wie ein Papagei, der Geräusche nachahmt, ohne irgendeine Ahnung davon zu haben, wohin der Satz führen würde.

Diese Arbeit mit dem Titel "What's the Plan?" (Was ist der Plan?) argumentiert, dass die KI tatsächlich ein strategischer Architekt und nicht nur ein Papagei ist. Sie zeigt, dass diese Modelle heimlich ihre zukünftigen Züge planen, während sie noch sprechen.

Hier ist, wie die Autoren dies bewiesen haben, unter Verwendung einfacher Analogien:

1. Die zwei Arten der Planung

Die Autoren definieren Planung in zwei Teilen, wie ein Dichter, der ein Gedicht verfasst:

  • Vorwärtsplanung (Der Bauplan): Bevor die zweite Hälfte eines Satzes geschrieben wird, erstellt die KI einen versteckten „Bauplan" in ihrem Gehirn. Sie weiß: „Ich muss diese Zeile mit einem Wort beenden, das auf 'Katze' reimt."
  • Rückwärtsplanung (Die Konstruktion): Während sie die mittleren Wörter des Satzes schreibt, formt sie diese subtil, um sicherzustellen, dass sie dieses „Katze"-Ende nahtlos erreichen kann. Es ist wie ein Fahrer, der eine Kurve sieht, die 100 Meter voraus liegt, und bereits jetzt abbremst und die Spur wechselt, obwohl er die Kurve noch gar nicht erreicht hat.

2. Das Experiment: Reime und Fragen

Um dies zu beweisen, baten die Forscher die KI nicht, einen komplexen Aufsatz zu schreiben. Sie gaben ihr zwei einfache Aufgaben:

  • Reimen: Sie gaben der KI die erste Zeile eines Gedichts und baten sie, die zweite Zeile mit einem spezifischen Reim zu beenden (z. B. wenn die erste Zeile mit „Ziegel" endet, muss die zweite mit „Stock", „Trick" oder „krank" enden).
  • Fragen beantworten: Sie stellten Fragen, bei denen die Antwort eine spezifische Grammatikregel erforderte, wie die Wahl zwischen „ein" und „eine" (z. B. „ein Wal" vs. „ein Auge").

3. Der „Fernbedienung"-Trick

Dies ist der coolste Teil der Arbeit. Die Forscher beobachteten die KI nicht nur; sie hackten ihr Gehirn mitten im Satz.

Stellen Sie sich vor, die KI schreibt ein Gedicht. Genau in dem Moment, als sie die erste Zeile beendet, nutzten die Forscher eine „Fernbedienung" (ein mathematischer Vektor), um das Gehirn der KI zu stupsen.

  • Der Stups: Sie sagten dem Gehirn der KI: „Vergiss den Reim, an den du dachtest. Plane jetzt für den Reim '-icht' (wie Licht oder Nacht)."
  • Das Ergebnis: Die KI änderte nicht nur das allerletzte Wort. Sie schrieb die Mitte des Satzes um.
    • Ohne den Stups: „Schwebend über dort, wo wahre Freude singt."
    • Mit dem Stups: „Schwebend über getaucht in goldenes Licht."

Die KI änderte Wörter wie „dort, wo wahre Freude" zu „getaucht in goldenes", weil sie eine Brücke zum neuen Ziel („Licht") bauen musste. Dies beweist, dass die KI die ganze Zeit einen Plan im Kopf hatte und ihren Pfad anpasste, um dem neuen Plan zu entsprechen.

4. Die Entdeckung der „Winzigen Gehirne"**

Eine große Überraschung in der Arbeit ist, dass sogar kleine KI-Modelle dies tun.
Früher glaubten Wissenschaftler, dass nur massive, superkomplexe Modelle vorausplanen könnten. Die Autoren fanden heraus, dass sogar Modelle mit nur 1 Milliarde Parametern (die in der Welt der KI relativ klein sind) diese Planung durchführen. Es ist nicht nur ein Merkmal der „superintelligenten" Modelle; es ist eine grundlegende Gewohnheit, wie diese Modelle funktionieren.

5. Der „Artikel"-Test

Sie testeten dies auch mit Fragen wie „Womit sieht man?" (Antwort: ein Auge).
Als sie die KI dazu anstießen, über „Herz" nachzudenken (was „ein" erfordert), begann die KI sofort, „ein" statt „eine" zu verwenden, bevor sie überhaupt das Wort „Herz" schrieb.
Das ist wie bei einer Person, die sagt: „Ich möchte ein..." und dann innehält, um ein Wort mit einem Konsonanten zu überlegen, anstatt zu sagen: „Ich möchte eine..." und dann zu merken, dass sie einen Fehler gemacht hat. Die KI kannte das Ziel, bevor sie die Reise begann.

Zusammenfassung

Die Arbeit behauptet, dass:

  1. KI vorausplant: Sie erstellt eine versteckte Karte dessen, wohin sie will, bevor sie dort ankommt.
  2. Sie den Pfad anpasst: Wenn Sie das Ziel mitten in der Reise ändern, ändert die KI die Schritte, die sie unternimmt, um dorthin zu gelangen, nicht nur den letzten Schritt.
  3. Es überall vorkommt: Dies geschieht in kleinen und großen Modellen, in Gedichten und in einfachen Fragen.

Die Autoren nutzten dies in dieser spezifischen Arbeit nicht, um neue Apps zu entwickeln oder Sicherheitsprobleme zu beheben; sie wollten lediglich beweisen, dass die „Magie" der KI nicht nur zufälliges Raten ist – es ist eine Form von versteckter, impliziter Planung.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →