Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents
Hera ist ein neuartiger schrittniveau-basierter Geräte-Cloud-Koordinator für LLM-Agenten mit langem Horizont, der ein zweistufiges Trainingsparadigma aus Imitationslernen und kostenbewusstem Reinforcement Learning einsetzt, um den Trade-off zwischen Aufgabenerfolg und Rechenkosten zu optimieren und dabei nahezu Cloud-only-Leistung bei deutlich reduzierter Cloud-Nutzung zu erreichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben einen sehr klugen, aber teuren Assistenten (die Cloud) und einen schnellen, günstigen, aber manchmal vergesslichen Assistenten (das Gerät). Sie benötigen beide, um gemeinsam ein langwieriges, kompliziertes Puzzle zu lösen, wie etwa die Planung eines einwöchigen Urlaubs oder die Navigation durch ein Labyrinth.
Das Problem lautet:
- Wenn Sie das Gerät alles erledigen lassen, ist es schnell und kostenlos, doch es könnte sich verirren oder bei den schwierigen Teilen des Puzzles Fehler machen.
- Wenn Sie die Cloud alles erledigen lassen, ist das Ergebnis perfekt, aber es kostet viel Geld und die Kommunikation dauert lange, da sie weit entfernt ist.
Die meisten bestehenden Systeme versuchen zu entscheiden: „Sollten wir die Cloud für diese gesamte Aufgabe einsetzen?" Wenn die Aufgabe schwierig erscheint, bezahlen sie für die Cloud. Wenn sie einfach erscheint, nutzen sie das Gerät. Doch das ist so, als würde man einen Meisterkoch engagieren, um jedes Gemüse für eine ganze Woche zu schneiden, nur weil die Speisekarte komplex ist, obwohl der Koch lediglich bei der kniffligen Garnierung helfen müsste.
Hier kommt Hera ins Spiel.
Hera ist ein neuer „Teamkapitän", der nicht für die gesamte Aufgabe entscheidet. Stattdessen beobachtet er die Arbeit Schritt für Schritt und trifft blitzschnelle Entscheidungen: „Ist dieser spezifische Zug einfach? Lass das Gerät ihn ausführen. Ist dieser Zug knifflig? Rufe die Cloud zur Hilfe."
Wie Hera lernt, ein großartiger Kapitän zu sein
Hera lernt, dieser Kapitän zu sein, durch einen zweistufigen Trainingsprozess, ähnlich wie ein Sporttrainer einen Athleten trainiert:
Stufe 1: Die „Shadowing"-Phase (Imitationslernen)
Zunächst beobachtet Hera, wie die Cloud die gesamte Aufgabe perfekt ausführt. Anschließend lässt sie das Gerät versuchen, exakt dieselben Schritte unter Verwendung der Antworten der Cloud als Leitfaden auszuführen.
- Wenn das Gerät den Schritt selbstständig richtig ausführt, lernt Hera: „Okay, das Gerät ist hier fähig. Keine Notwendigkeit, die teure Cloud zu rufen."
- Wenn das Gerät verwirrt ist oder eine andere Wahl trifft, lernt Hera: „Aha, dieser Schritt ist für das Gerät zu schwer. Wir brauchen hier die Hilfe der Cloud."
Dies gibt Hera eine grundlegende Regelmappe darüber, wo das Gerät Schwierigkeiten hat.
Stufe 2: Die „Strategie"-Phase (Bestärkendes Lernen)
Nun darf Hera das Spiel selbst spielen. Es versucht, Aufgaben zu lösen, indem es Schritte des Geräts und der Cloud mischt. Es erhält eine Punktzahl basierend auf zwei Faktoren:
- Haben wir gewonnen? (Wurde die Aufgabe erledigt?)
- Haben wir zu viel ausgegeben? (Haben wir die Cloud zu oft gerufen?)
Hera lernt, dass es die Cloud nicht für jeden schwierigen Schritt benötigt. Es lernt, dass es manchmal ausreicht, die Cloud nur für einen kritischen Schritt in der Mitte einer langen Reise zu rufen, um den gesamten Plan auf Kurs zu halten. Es lernt, Geld zu sparen, indem es die Cloud nur dann ruft, wenn es absolut notwendig ist, um ein Scheitern zu vermeiden.
Die Ergebnisse: Das Beste aus beiden Welten
Die Forscher testeten Hera an drei verschiedenen „Puzzles":
- ALFWorld: Ein Roboter, der versucht, ein Haus aufzuräumen.
- WebShop: Ein Agent, der versucht, bestimmte Artikel auf einer Website zu kaufen.
- AppWorld: Ein Agent, der versucht, Code zu schreiben, um Apps zu verwalten.
Die magischen Zahlen:
- Erfolgsrate: Hera erreichte 92,5 % der Erfolgsrate einer durchgängigen Nutzung der Cloud. Es versagt fast nie.
- Kosteneinsparungen: Es nutzte die teure Cloud nur für 46,3 % der Schritte. Das Gerät erledigte den Rest.
- Geschwindigkeit: Da es so häufig das lokale Gerät nutzte, war der gesamte Prozess viel schneller als das Warten auf die Cloud bei jedem einzelnen Schritt.
Das Fazit
Stellen Sie sich Hera als einen klugen Manager vor, der genau weiß, wann er den Junior-Mitarbeiter (Gerät) die Routinearbeiten erledigen lassen kann und wann er den Senior-Experten (Cloud) für die schwierigen Probleme hinzuziehen muss. Auf diese Weise beendet das Team die Arbeit fast genauso gut, als hätte der Experte alles erledigt, jedoch zur Hälfte der Kosten und mit doppelter Geschwindigkeit.
Die Studie behauptet, dies sei das erste System, das diese Entscheidungen Schritt für Schritt und nicht für die gesamte Aufgabe trifft, und beweist, dass man für jeden einzelnen Zug keinen Supercomputer benötigt, um ein komplexes Problem zu lösen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.