← Neueste Arbeiten
🤖 machine learning

Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

Dieser Beitrag adressiert die Herausforderung der Zero-Shot-Koordination im Multi-Agenten-Reinforcement-Learning mit spärlichen Belohnungen durch die Einführung einer Ensemble-Trainingsmethode mit randomisierten Belohnungsformulierungen, welche die Kooperation von Agenten mit Partnern, die unterschiedliche Belohnungsformulierungsstrategien verwenden, im Overcooked-Umfeld signifikant verbessert.

Ursprüngliche Autoren: Keenan Powell, Peihong Yu, Pratap Tokekar

Veröffentlicht 2026-04-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Keenan Powell, Peihong Yu, Pratap Tokekar

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten eine Gruppe von Robotern darin, gemeinsam in einer belebten Küche zu kochen. Das Ziel ist einfach: So viele Suppen wie möglich zubereiten, bevor die Zeit abläuft. Allerdings gibt es einen Haken. Sie trainieren sie nicht, um mit einem bestimmten, Ihnen bekannten Partner zu arbeiten; Sie trainieren sie, um mit jedem Roboter zusammenzuarbeiten, dem sie in Zukunft begegnen könnten, selbst wenn dieser Roboter von einem anderen Unternehmen, auf einem anderen Computer oder mit einer leicht abweichenden Regelmenge trainiert wurde.

Dies ist das Problem der Zero-Shot-Koordination (ZSC). Es ist, als würde man versuchen, mit einem Fremden zu tanzen, ohne jemals gemeinsam geübt zu haben. Wenn beide exakt dieselben Tanzschritte gelernt hätten, wären Sie perfekt. Aber wenn Ihr Partner eine leicht abweichende Version des Tanzes gelernt hat, könnten Sie sich gegenseitig auf die Füße treten.

Das Problem: „Gleiches Ziel, unterschiedliche Motivationen"

In der Vergangenheit versuchten Forscher, dies zu lösen, indem sie allen Robotern exakt dieselbe „Punkteliste" (Belohnungsfunktion) gaben. Wenn ein Roboter eine Zwiebel in einen Topf legt, erhält er einen Punkt. Wenn er einen Teller aufnimmt, erhält er einen Punkt.

Aber in der realen Welt könnten Roboter (oder autonome Fahrzeuge oder Drohnen) dasselbe große Ziel teilen (das Ziel erreichen oder die Suppe kochen), aber sie könnten die Schritte unterschiedlich bewerten.

  • Roboter A könnte denken: „Geschwindigkeit ist alles! Ich erhalte Punkte für schnelles Bewegen."
  • Roboter B könnte denken: „Sicherheit ist alles! Ich erhalte Punkte für Vorsicht."

Wenn Sie Ihren Roboter nur darauf trainieren, mit anderen „Geschwindigkeits"-Robotern zu arbeiten, wird er kläglich scheitern, wenn er mit einem „Sicherheits"-Roboter gepaart wird. Die Arbeit argumentiert, dass bestehende Methoden dies nicht berücksichtigt haben. Sie gingen davon aus, dass alle dieselbe interne „Punkteliste" haben.

Die Lösung: Das „Vielfältige Trainingslager"

Die Autoren schlagen eine neue Methode vor, um diese Roboter zu trainieren. Anstatt sie alle mit derselben Punkteliste zu trainieren, schaffen sie ein vielfältiges Trainingslager.

Sie verwenden vier verschiedene Methoden, um eine Vielzahl von „Punktelisten" (genannt Reward Shapings) zu erstellen, auf denen die Roboter lernen sollen:

  1. Der „LLM-basierte" Trainer: Sie bitten eine hochintelligente KI (ein Large Language Model), Beispiele dafür zu betrachten, was funktioniert hat und was nicht, und dann eine brandneue Liste von Regeln zu verfassen, die eine Mischung verschiedener Robotertypen erzeugen würde.
  2. Der „Surrogat-Netzwerk"-Trainer: Sie trainieren eine kleine, einfache KI, um vorherzusagen, welche Regeln zu den besten Kochergebnissen führen. Sie wählt dann die leistungsstärksten Regeln aus einer riesigen Liste von Möglichkeiten aus.
  3. Der „Stratifizierte Gitter"-Trainer: Dies ist wie ein akribischer Organisator. Sie nehmen jede mögliche Regel (wie „wie viel Geschwindigkeit gewichtet werden soll" oder „wie viel Sicherheit gewichtet werden soll") und teilen den Bereich in gleiche Scheiben auf. Sie wählen eine Regel aus jeder Scheibe aus, um sicherzustellen, dass sie das gesamte Spektrum der Möglichkeiten abdecken, ohne etwas zu verpassen.
  4. Der „Zufällige" Trainer: Sie wählen Regeln einfach völlig zufällig aus. (Dies ist die Kontrollgruppe, wie das Würfeln).

Das Ensemble: Das „All-Star-Team"

Sobald sie viele verschiedene Roboter mit diesen verschiedenen Regelbüchern trainiert haben, wählen sie nicht einfach einen aus, um ihn einzusetzen. Stattdessen erstellen sie ein Ensemble.

Stellen Sie sich dies wie ein Super-Team vor. Wenn der Roboter in die Küche kommt, um mit einem Fremden zu arbeiten, agiert er nicht einfach als „Roboter A" oder „Roboter B". Er agiert als Ausschuss. Er fragt alle verschiedenen Versionen seiner selbst (die mit unterschiedlichen Regeln trainiert wurden), was sie tun würden, und folgt dann der populärsten Antwort.

Dies macht den Roboter unglaublich anpassungsfähig. Er hat jede denkbare Denkweise über das Problem gesehen, sodass er herausfinden kann, wie er mit einem Fremden zusammenarbeiten kann, egal wie dieser Fremde denkt.

Die Ergebnisse: Erfolg kochen

Die Forscher testeten dies im Spiel Overcooked (ein beliebtes Videospiel über kooperatives Kochen). Sie stellten ihr „All-Star-Team" Robotern gegenüber, die mit völlig unbekannten Regeln trainiert wurden.

  • Das Ergebnis: Ihre Methode war ein großer Erfolg. Im Vergleich zu den alten Methoden verbesserten ihre Roboter ihre Leistung um 62 % bis 119 %.
  • Die Gewinner: Der „Stratifizierte Gitter"-Trainer (der akribische Organisator) und der „Surrogat-Netzwerk"-Trainer (der Vorhersager) waren die besten Trainer. Sie erstellten Teams, die Fremden am effektivsten begegnen konnten.
  • Die Überraschung: Selbst der „Zufällige" Trainer (der Regeln einfach durch Würfeln auswählte) schlug die alten Standardmethoden, was beweist, dass bereits einige Vielfalt besser ist als gar keine.

Die große Erkenntnis

Die Arbeit zeigt, dass man, um Roboter zu lehren, mit Fremden zusammenzuarbeiten, ihnen nicht nur eine Denkweise beibringen sollte. Man sollte ihnen eine Vielfalt von Denkweisen beibringen, indem man ihnen während des Trainings verschiedene „Punktelisten" gibt. Dann können sie, indem sie all diese verschiedenen Perspektiven zu einem intelligenten Team kombinieren, sich an jeden Partner anpassen, dem sie begegnen, selbst wenn dieser Partner nach einer völlig anderen Regelmenge spielt.

Kurz gesagt: Wenn Sie ein guter Tanzpartner für jeden sein wollen, lernen Sie nicht nur einen Tanz. Lernen Sie ein wenig von allem, und lassen Sie dann Ihren inneren Ausschuss entscheiden, welcher Zug der beste ist, wenn Sie auf die Tanzfläche treten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →