Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience
Dieser Artikel schlägt ein Reinforcement-Learning-Framework vor, das ein leichtgewichtiges Prompter-Modell durch iterative Distillation von Erfahrung optimiert, um die Fähigkeiten mehrstufiger Schlussfolgerungen und der Werkzeugnutzung eingefrorener Black-Box-LLMs signifikant zu verbessern und dabei im Vergleich zu evolutionären State-of-the-Art-Baselines überlegene Leistung und Sample-Effizienz zu erzielen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Ganze: Das „Black-Box"-Problem
Stellen Sie sich vor, Sie haben einen superschlauen, Billionen-Dollar-Roboter (eine „Black-Box"-KI), den Sie nicht anfassen, öffnen oder neu programmieren können. Sie können nur über ein Walkie-Talkie mit ihm sprechen. In der Vergangenheit mussten Sie, wenn Sie wollten, dass dieser Roboter eine bestimmte Aufgabe besser erledigt, sein Gehirn neu verkabeln (Feinabstimmung). Da Sie das Gehirn jedoch nicht berühren können, müssen Sie sehr clever sein mit dem, was Sie ihm sagen. Dies nennt man Prompt-Engineering.
Das Problem ist, dass das Finden des perfekten Satzes wie das Raten der Gewinnzahlen im Lotto ist, indem man zufällige Phrasen herumschreit. Manchmal führt eine winzige Änderung Ihrer Worte dazu, dass der Roboter völlig versagt.
Die Lösung: Ein „Prompter"-Trainer und ein „Arbeiter"-Roboter
Die Autoren schlagen ein neues System mit zwei Charakteren vor:
- Der Arbeiter: Der große, eingefrorene, superschlauge Roboter, der die harte Arbeit tatsächlich verrichtet (wie das Lösen von Matheaufgaben oder das Buchen von Flügen). Diesen ändern wir niemals.
- Der Prompter: Eine kleinere, günstigere, trainierbare „Trainer"-KI. Ihre einzige Aufgabe ist es, die perfekten Anweisungen (den Prompt) für den Arbeiter zu schreiben.
Stellen Sie es sich wie einen Schachtrainer (den Prompter) und einen Großmeister-Spieler (den Arbeiter) vor. Der Trainer spielt das Spiel nicht; er findet nur die besten Eröffnungszüge heraus, um sie dem Großmeister zu sagen. Der Trainer lernt, indem er beobachtet, was passiert, wenn der Großmeister spielt.
Wie sie den Trainer unterrichten: Der „Erfahrungspuffer"
Normalerweise ist das Trainieren einer KI schwierig, weil man am Ende nur eine einfache „Richtig" oder „Falsch"-Bewertung erhält. Das ist wie einem Schüler zu sagen: „Sie haben den Test nicht bestanden", ohne ihm zu sagen, warum.
Dieses Papier stellt einen speziellen Trick vor, den kontrastiven Erfahrungspuffer.
- Die Analogie: Stellen Sie sich einen Fitnessstudio-Trainer vor, der nicht nur „Gut gemacht" oder „Schlecht gemacht" sagt. Stattdessen führt der Trainer ein Notizbuch (den Puffer) über jedes Training.
- Wenn der Athlet erfolgreich ist, notiert der Trainer genau, was er richtig gemacht hat.
- Wenn er scheitert, schreibt der Trainer eine detaillierte Kritik: „Sie haben den Ellbogen zu hoch gehoben" oder „Sie haben das Atmen vergessen".
- Die Magie: Die Trainer-KI liest dieses Notizbuch vor jedem neuen Versuch. Sie lernt aus den Geschichten vergangener Erfolge und Misserfolge, nicht nur aus der Endpunktzahl. Dies ermöglicht es dem Trainer, viel schneller zu lernen, als wenn er nur raten würde.
Die Ergebnisse: Von ungeschickt zum Meister
Die Forscher testeten dies an zwei Arten schwieriger Aufgaben:
Logikrätsel (Das „Netzwerk der Lügen"):
- Die Aufgabe: Herausfinden, wer in einer Kette verworrener Aussagen die Wahrheit sagt.
- Das Ergebnis: Die Standard-KI lag in etwa 55 % der Fälle richtig. Das Trainer-Arbeiter-Team lag in 90 % der Fälle richtig.
- Was der Trainer gelernt hat: Der Trainer hörte auf, den Arbeiter zu bitten, „einfach hart nachzudenken". Stattdessen lernte er, dem Arbeiter zu sagen, er solle sich wie ein strenger „Staatsprüfer" verhalten, der jeden einzelnen Schritt gegen die Rohdaten überprüft und sich weigert, seiner eigenen Intuition zu vertrauen.
Werkzeugnutzung (Flugbuchung & Einkaufen):
- Die Aufgabe: Die Nutzung eines Computersystems zum Buchen eines Fluges oder zur Rücksendung eines Hemds, was das Befolgen strenger Regeln und das Klicken spezifischer Tasten in der richtigen Reihenfolge erfordert.
- Das Ergebnis: Die Erfolgsraten stiegen von 74 % auf 91 %.
- Was der Trainer gelernt hat: Der Trainer entdeckte, dass der Arbeiter oft versuchte, zu viele Dinge gleichzeitig zu tun. Der Trainer lernte, Anweisungen wie ein „Protokoll-Ingenieur" zu geben, indem er den Arbeiter zwang, einen winzigen Schritt zu tun, das Ergebnis zu prüfen und dann den nächsten Schritt zu machen, wodurch verhindert wurde, dass der Arbeiter verwirrt wird.
Warum dies wichtig ist
- Geschwindigkeit: Da der Trainer aus detaillierten Notizen (dem Puffer) lernt und nicht nur aus Punktzahlen, lernt er 2,4-mal schneller als frühere Methoden.
- Effizienz: Sie müssen den riesigen, teuren Arbeiter-Roboter nicht neu trainieren. Sie trainieren nur den winzigen, günstigen Trainer.
- Entdeckung: Das System fand nicht nur einen besseren Satz; es entdeckte neue Strategien. Zum Beispiel fand der Trainer bei der Flugbuchung heraus, dass man die Kabine vor dem Ändern der Flugdaten upgraden muss, eine spezifische Regel, die der Arbeiter nicht von selbst zu befolgen wusste.
Zusammenfassung
Dieses Papier zeigt, dass wir statt zu versuchen, die riesige KI zu reparieren, einen kleinen, klugen „Prompter" als Trainer ausbilden können. Indem wir diesem Trainer ein Notizbuch mit detailliertem Feedback geben (was richtig und was falsch lief), lernt der Trainer, Anweisungen zu schreiben, die eine gute KI in eine großartige verwandeln und komplexe Logik- und Werkzeugnutzungsprobleme mit viel höherer Genauigkeit lösen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.