← Neueste Arbeiten
💬 NLP

How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models

Dieser Beitrag stellt Advisor Models vor, eine Methode, die kleine Open-Weight-Modelle trainiert, um dynamische, instanzspezifische natürliche Sprachempfehlungen zu generieren und so die Leistung unzugänglicher Black-Box-Frontier-LLMs durch parametrische Optimierung effektiv zu steuern und zu verbessern, ohne deren Gewichte zu verändern.

Ursprüngliche Autoren: Parth Asawa, Alan Zhu, Abigail O'Neill, Matei Zaharia, Alexandros G. Dimakis, Joseph E. Gonzalez

Veröffentlicht 2026-05-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Parth Asawa, Alan Zhu, Abigail O'Neill, Matei Zaharia, Alexandros G. Dimakis, Joseph E. Gonzalez

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen brillanten, weltklasse Koch (das Black-Box-Modell, wie GPT-5 oder Gemini), der in einer versiegelten, hochgesicherten Küche arbeitet. Sie können die Zutaten nicht anfassen, die Rezepte nicht ändern und nicht einmal sehen, wie er das Gemüse schneidet. Sie können ihm nur eine Notiz mit Ihrer Bestellung schicken (ein Prompt).

Normalerweise müssen Sie, wenn Sie ein bestimmtes Gericht wünschen, eine sehr lange, perfekte Notiz schreiben. Aber wenn Sie einen Fehler in der Notiz machen, könnte der Koch immer noch ein großartiges Gericht zubereiten, oder er könnte verwirrt sein. Und wenn Sie wollen, dass sich der Koch jedes Mal an Ihren spezifischen Geschmack anpasst, ist das Schreiben einer neuen perfekten Notiz für jede Bestellung ermüdend und scheitert oft.

ADVISOR-MODELLE sind wie die Einstellung eines kleinen, klugen Sous-Chefs (des Beraters), der direkt vor der versiegelten Küchentür steht.

So funktioniert es, Schritt für Schritt:

1. Das Setup: Die Aufgabe des Sous-Chefs

Anstatt dass Sie versuchen, die perfekte Notiz für den Meisterkoch zu schreiben, bitten Sie den Sous-Chef, Ihre Bestellung zu prüfen und einen maßgeschneiderten Tipp für den Meisterkoch zu schreiben.

  • Der Meisterkoch (Black-Box): Arbeitet immer noch genau gleich. Sie können sein Gehirn oder seine Ausbildung nicht ändern. Er folgt einfach der Notiz, die er erhält.
  • Der Sous-Chef (Berater): Dies ist ein kleineres, günstigeres, quelloffenes Modell. Seine einzige Aufgabe ist es, die spezifische Bestellung zu prüfen und zu sagen: „Hey, für diese spezifische Anfrage sollte der Meisterkoch versuchen, X, Y und Z zu tun."

2. Das Training: Lernen durch Tun

Wie lernt der Sous-Chef, gute Tipps zu geben?

  • Die Schleife: Sie geben dem Sous-Chef eine Aufgabe. Der Sous-Chef schreibt einen Tipp. Der Meisterkoch liest den Tipp und kocht das Essen.
  • Die Bewertung: Wenn das Essen köstlich wird (die Aufgabe korrekt gelöst ist), gibt das System dem Sous-Chef ein „Daumen hoch". Wenn das Essen verbrannt ist, bekommt er ein „Daumen runter".
  • Die Lektion: Der Sous-Chef lernt aus diesen Bewertungen. Im Laufe der Zeit hört er auf, vage Ratschläge wie „Kochen Sie es gut" zu geben, und beginnt, spezifische, umsetzbare Ratschläge zu geben wie „Überprüfen Sie die Temperatur auf dem Herd" oder „Verwenden Sie genau 10 Wörter für diese Bewertung".

3. Der Trick: Der „günstige" Sous-Chef hilft dem „teuren" Koch

Dies ist die größte Behauptung des Papers. Sie müssen den Sous-Chef nicht mit dem teuren, weltklasse Meisterkoch trainieren.

  • Sie können den Sous-Chef mit einem günstigen, kleineren Koch (wie GPT-4o mini) trainieren.
  • Sobald der Sous-Chef gelernt hat, dem günstigen Koch großartige Tipps zu geben, können Sie denselben trainierten Sous-Chef vor den teuren, weltklasse Koch (wie GPT-5) stellen.
  • Das Ergebnis: Der teure Koch wird plötzlich besser bei spezifischen Aufgaben, obwohl der teure Koch niemals trainiert wurde! Die Tipps sind so klar und hilfreich, dass der große Koch sie perfekt versteht.

Reale Beispiele aus dem Paper

Die Autoren testeten dieses „Sous-Chef"-System in drei verschiedenen Küchen:

  • Die Steuer-Küche (RuleArena Taxes):

    • Das Problem: Der Meisterkoch ist großartig im allgemeinen Kochen, wird aber von komplexen Steuervorschriften verwirrt.
    • Die Lösung: Der trainierte Sous-Chef lernte, spezifische Anweisungen zur Berechnung von Steuern zu geben.
    • Das Ergebnis: Die Genauigkeit des Meisterkochs stieg von 67 % auf 85 %.
  • Die Software-Reparatur-Küche (SWE Agent):

    • Das Problem: Der Koch benötigte zu viele Schritte, um einen defekten Codeabschnitt zu reparieren (wie das Durchsuchen jedes einzelnen Schubladens in der Küche).
    • Die Lösung: Der Sous-Chef lernte zu sagen: „Überprüfen Sie nicht die Schubladen; verwenden Sie einfach den Suchbefehl, um den defekten Teil zu finden."
    • Das Ergebnis: Der Koch reparierte den Code 24 % schneller, ohne mehr Fehler zu machen.
  • Die Küche für persönlichen Geschmack (Personalisierung):

    • Das Problem: Sie haben 5 verschiedene Freunde. Einer mag kurze Bewertungen, einer lange, und einer hasst Matheaufgaben. Der Meisterkoch weiß das nicht.
    • Die Lösung: Der Sous-Chef lernte, die „versteckten" Präferenzen jedes Freundes zu lesen und dem Koch genau zu sagen, was zu tun ist.
    • Das Ergebnis: Das System lernte diese versteckten Präferenzen fast perfekt (94–99 % Genauigkeit), während Standardmethoden völlig versagten.

Warum das wichtig ist (laut dem Paper)

  • Keine Operation erforderlich: Sie müssen das Gehirn des Meisterkochs nicht aufschneiden (seine Gewichte modifizieren), um ihn zu verbessern. Sie geben ihm einfach bessere Anweisungen.
  • Kein Vergessen: Da das Gehirn des Meisterkochs nicht verändert wird, vergisst er nicht, wie man andere Dinge tut. Er bleibt gut in allem, wofür er ursprünglich gut war.
  • Kosteneffizient: Es ist viel billiger, den kleinen Sous-Chef auf einem günstigen Modell zu trainieren und diese Fähigkeiten dann auf das teure Modell zu „übertragen", als zu versuchen, das teure Modell direkt zu trainieren.

Kurz gesagt: ADVISOR-MODELLE sind eine Möglichkeit, einen kleinen, intelligenten Assistenten zu trainieren, der bessere Anweisungen für einen riesigen, eingeschlossenen KI schreibt, wodurch dieser riesige KI intelligenter, schneller und persönlicher wird, ohne jemals seinen internen Code zu berühren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →