← Neueste Arbeiten
🤖 AI

AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning

AgentJet ist ein flexibles, verteiltes Schwarm-Trainings-Framework, das die Agenten-Ausführung von der Modelloptimierung entkoppelt, um heterogenes Multi-Modell-Reinforcement-Learning, fehlertolerantes Multi-Task-Training und Live-Code-Iterationen zu ermöglichen, während es gleichzeitig ein automatisiertes System für autonome Langzeit-RL-Forschung einführt.

Ursprüngliche Autoren: Qingxu Fu, Boyin Liu, Shuchang Tao, Zhaoyang Liu, Bolin Ding

Veröffentlicht 2026-06-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Qingxu Fu, Boyin Liu, Shuchang Tao, Zhaoyang Liu, Bolin Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Team von Robotern ein komplexes Spiel beizubringen, wie zum Beispiel Werewolf oder das Lösen schwieriger mathematischer Probleme. Auf dem alten Weg des „zentralisierten“ Frameworks waren die Roboter und der Lehrer an denselben Raum gebunden. Wenn ein Roboter über seine eigenen Kabel stolperte, abstürzte oder in einer Endlosschleife stecken blieb, musste der gesamte Unterricht gestoppt werden, der Lehrer musste zusammenpacken und alle mussten warten, bis der Lehrer alles wieder neu eingerichtet hatte, bevor das Lernen fortgesetzt werden konnte.

AgentJet ist eine neue, intelligentere Art, diesen Unterricht zu organisieren. Die Autoren nennen es ein „Swarm Training Framework“ (Schwarm-Trainings-Framework). So funktioniert es, unter Verwendung einfacher Analogien:

1. Die „Schwarm“-Architektur: Der Lehrer vs. die Studenten

Anstatt dass alle in einem Raum sind, teilt AgentJet die Arbeit in zwei unterschiedliche Gruppen auf, die miteinander kommunizieren, aber nicht voneinander abhängen, um „am Leben zu bleiben“:

  • Die Swarm Server (Die Lehrer): Dies sind leistungsstarke Computer mit schwerer Grafikhardware (GPUs). Ihre einzige Aufgabe ist es, das „Gehirn“ (das KI-Modell) zu halten und das eigentliche Lernen (das Aktualisieren der Mathematik) durchzuführen. Sie bleiben stabil und fokussiert.
  • Die Swarm Clients (Die Studenten): Dies sind leichte Computer (sogar Ihr Laptop!), die die eigentlichen Aufgaben ausführen. Sie agieren als Agenten, kommunizieren mit der Außenwelt, nutzen Werkzeuge und machen Fehler.

Die Magie: Wenn ein „Studenten“-Computer abstürzt, weil er versucht hat, eine defekte Website zu öffnen oder weil der Speicher voll war, bemerkt der „Lehrer“ dies nicht einmal. Der Lehrer wartet einfach darauf, dass ein neuer Student sich in der Schlange anstellt. Das Lernen stoppt nie und es geht kein Fortschritt verloren. Es ist, als würde ein Lehrer Hausaufgaben korrigieren, während Studenten Besorgungen machen; wenn ein Student stolpert, korrigiert der Lehrer weiter.

2. Das Problem des „redundanten Kontextes“ lösen (Timeline Merging)

Wenn ein KI-Agent lange Zeit mit der Außenwelt kommuniziert, wiederholt er sich oft selbst. Stellen Sie sich vor, ein Student schreibt jeden Tag einen Tagebucheintrag, aber jeder neue Eintrag beginnt damit, den gesamten vorherigen Tagebucheintrag der letzten Woche zu kopieren. Das verschwendet eine enorme Menge an Papier (und Rechenleistung).

AgentJet besitzt eine spezielle Funktion namens Timeline Merging. Es betrachtet den langen Gesprächsverlauf, erkennt die wiederholten Teile und „versticht“ sie zusammen.

  • Das Ergebnis: Es schneidet den unnötigen Ballast heraus. Das Paper behauptet, dass dies das Training um das 1,5- bis 10-fache beschleunigt, weil die KI keine Zeit mehr damit verschwendet, immer wieder dieselben Anweisungen neu zu lesen.

3. Verschiedene Modelle und Aufgaben mischen (Die „Cocktail“-Party)

In der Vergangenheit haben Sie normalerweise meistens einen Typ von Roboter trainiert, um eine bestimmte Art von Aufgabe zu erledigen. AgentJet ermöglicht einen „Cocktail-Training“-Ansatz:

  • Verschiedene Gehirne: Sie können ein kleines, schnelles Gehirn (7B Parameter) für einfache Aufgaben und ein riesiges, intelligentes Gehirn (32B Parameter) für komplexe Planungen gleichzeitig trainieren. Sie müssen nicht dasselbe Gehirn teilen; sie können völlig unterschiedlich sein.
  • Verschiedene Jobs: Sie können einen Studenten haben, der Mathematik übt, während ein anderer das Programmieren übt, und beide schicken ihre Hausaufgaben an denselben Lehrer. Der Lehrer lernt aus beiden, ohne verwirrt zu werden.

4. Das „Hot-Swap“-Debugging (Live-Editierung)

Normalerweise, wenn Sie den Code eines KI-Agenten ändern wollen, müssen Sie die gesamte Trainingssitzung stoppen, den Code fixen, den Server neu starten und 10 Minuten warten, bis alles geladen ist.
Mit AgentJet, da der „Student“ (der Code) vom „Lehrer“ (dem Modell) getrennt ist, können Sie einfach den Studenten austauschen, während der Lehrer weiterarbeitet. Es ist, als würde man einen Spieler in einem Fußballspiel auswechseln, ohne das Spiel zu unterbrechen. Sie können den Code bearbeiten, den Client neu starten und das Training setzt sofort fort.

5. Der automatisierte Forscher (Das „selbstfahrende Labor“)

Das Paper führt ein System ein, bei dem eine KI als Forscher fungieren kann.

  • Der Arbeitsablauf: Sie geben der KI ein Thema (z. B. „Finde die besten Einstellungen für dieses Mathe-Modell“).
  • Die Aktion: Die KI schreibt automatisch den Code, setzt die „Studenten“ und „Lehrer“ auf, führt tagelang Experimente durch, analysiert die Ergebnisse und behebt sogar ihre eigenen Fehler.
  • Die Behauptung: Die Autoren sagen, dass sie dies an sechs verschiedenen Forschungsprojekten getestet haben (wie das Tuning von Hyperparametern oder den Vergleich von Modellgrößen) und die KI diese langfristigen Experimente erfolgreich durchgeführt hat, ohne dass ein Mensch die Tastatur berühren musste.

Zusammenfassung dessen, was sie behaupten

Das Paper behauptet, dass sie durch die Trennung des „Tuns“ (Clients) vom „Lernen“ (Servern) Folgendes erreichen können:

  1. Abstürze verhindern, die den gesamten Trainingsprozess stoppen könnten.
  2. Verschiedene Arten von KI (unterschiedliche Größen, unterschiedliche Aufgaben) effizient gemeinsam zu trainieren.
  3. Das Training beschleunigen, indem sie repetitive Texte aus dem Gedächtnis der KI entfernen.
  4. KI-Forscher in die Lage zu versetzen, ihre eigenen Experimente automatisch durchzuführen, indem sie die langweilige Engineering-Arbeit bewältigen, damit Menschen sich auf die großen Ideen konzentrieren können.

Die Autoren betonen, dass dies Open-Source ist und mit allen bestehenden KI-Agent-Tools funktioniert, was bedeutet, dass Sie Ihren Code nicht umschreiben müssen, um es zu nutzen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →