← Nieuwste papers
🤖 AI

AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning

AgentJet is een flexibel, gedistribueerd swarm-trainingsframework dat de uitvoering van agenten ontkoppelt van modeloptimalisatie om heterogene multi-model reinforcement learning, fouttolerante multi-task training en live code-iteratie mogelijk te maken, terwijl het een geautomatiseerd systeem introduceert voor autonome long-horizon RL-onderzoek.

Oorspronkelijke auteurs: Qingxu Fu, Boyin Liu, Shuchang Tao, Zhaoyang Liu, Bolin Ding

Gepubliceerd 2026-06-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qingxu Fu, Boyin Liu, Shuchang Tao, Zhaoyang Liu, Bolin Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team robots probeert te leren hoe ze een complex spel moeten spelen, zoals Werewolf of het oplossen van moeilijke wiskundige problemen. In de oude manier van doen (met behulp van "gecentraliseerde" frameworks) zaten de robots en de leraar vast in dezelfde kamer. Als één robot over zijn eigen draden struikelde, crashte of in een loop vastliep, moest het hele klaslokaal stoppen, de leraar inpakken en moest iedereen wachten tot de leraar alles weer opnieuw had opgesteld voordat het leren kon hervatten.

AgentJet is een nieuwe, slimmere manier om dit klaslokaal te organiseren. De auteurs noemen het een "Swarm Training Framework." Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Swarm" Architectuur: De Leraar versus de Studenten

In plaats van dat iedereen in één kamer zit, splitst AgentJet het werk op in twee duidelijke groepen die met elkaar communiceren maar niet van elkaar afhankelijk zijn om te blijven functioneren:

  • De Swarm Servers (De Leraren): Dit zijn krachtige computers met zware grafische kaarten (GPU's). Hun enige taak is het vasthouden van het "brein" (het AI-model) en het daadwerkelijk leren (het bijwerken van de wiskunde). Zij blijven stabiel en gefocust.
  • De Swarm Clients (De Studenten): Dit zijn lichtgewicht computers (zelfs je laptop!) die de eigenlijke taken uitvoeren. Ze fungeren als de agenten, praten met de buitenwereld, gebruiken tools en maken fouten.

De Magie: Als een "Student"-computer crasht omdat hij een kapotte website probeerde te openen of het geheugen vol liet lopen, merkt de "Leraar" dat niet eens op. De Leraar wacht gewoon tot er een nieuwe Student bij de rij aansluit. Het leren stopt nooit en er gaat geen voortgang verloren. Het is alsof een leraar huiswerk nakijkt terwijl studenten boodschappen doen; als één student struikelt, gaat de lener door met nakijken.

2. Het Oplossen van het "Redundant Context" Probleem (Timeline Merging)

Wanneer een AI-agent gedurende een lange tijd met de buitenwereld communiceert, herhaalt hij zichzelf vaak. Stel je voor dat een student elke dag een dagboekfragment schrijft, maar dat elke nieuwe invoer begint door het hele vorige weekverslag te kopiëren. Dit verspilt een enorme hoeveelheid papier (en computerkracht).

AgentJet heeft een speciale functie genaamd Timeline Merging. Het kijkt naar de lange gesprekshistorie, ziet de herhaalde delen en "naait" deze aan elkaar.

  • Het Resultaat: Het snijdt de overbodige informatie weg. Het papier beweert dat dit de training 1,5 tot 10 keer sneller maakt, omdat de AI geen tijd verspilt aan het steeds opnieuw lezen van dezelfde instructies.

3. Het Mengen van Verschillende Modellen en Taken (Het "Cocktailparty"-effect)

In het verleden trainde je meestal één type robot voor één specifiek werk. AgentJet staat een "Cocktail Training"-aanpak toe:

  • Verschillende Breinen: Je kunt een klein, snel brein (7B parameters) hebben dat eenvoudige taken uitvoert en een gigantisch, slim brein (32B parameters) dat complexe planning doet, terwijl ze allemaal tegelijkertijd trainen. Ze hoeven niet hetzelfde brein te delen; ze kunnen totaal verschillend zijn.
  • Verschillende Banen: Je kunt één student laten oefenen met wiskunde terwijl een andere oefent met coderen, en ze sturen beide hun huiswerk naar dezelfde leraar. De leraar leert van beiden zonder in de war te raken.

4. De "Hot-Swap" Debugging (Live Bewerken)

Normaal gesproken, als je de code van een AI-agent wilt aanpassen, moet je de hele trainingssessie afsluiten, de code repareren, de server herstarten en 10 minuten wachten tot alles geladen is.
Met AgentJet, omdat de "Student" (de code) gescheiden is van de "Leraar" (het model), kun je simpelweg de student vervangen terwijl de leraar doorgaat met werken. Het is also kind de een speler in een voetbalwedstrijd wisselt zonder de wedstrijd te onderbreken. Je kunt de code aanpassen, de client herstarten en de training gaat direct door.

5. De Geautomatiseerde Onderzoeker (Het "Zelfrijdende Lab")

Het paper introduceert een systeem waarbij een AI als onderzoeker kan optreden.

  • De Workflow: Je geeft de AI een onderwerp (bijv. "Vind de beste instellingen voor dit wiskundige model").
  • De Actie: De AI schrijft automatisch de code, zet de "Students" en "Teachers" op, voert dagenlang experimenten uit, analyseert de resultaten en repareert zelfs zijn eigen fouten.
  • De Claim: De auteurs zeggen dat ze dit getest hebben op zes verschillende onderzoeksprojecten (zoals het afstemmen van hyperparameters of het vergelijken van modelgroottes) en dat de AI deze langdurige experimenten succesvol heeft uitgevoerd zonder dat een mens het toetsenbord hoefde aan te raken.

Samenvatting van wat zij claimen

Het paper beweert dat door het "doen" (clients) te scheiden van het "leren" (servers), zij kunnen:

  1. Crashes voorkomen die het hele trainingsproces onderbreken.
  2. Verschillende soorten AI (verschillende groottes, verschillende taken) efficiënt samen te trainen.
  3. Training versnellen door repetitieve tekst uit het geheugen van de AI te verwijderen.
  4. AI-onderzoekers hun eigen experimenten te laten draaien automatisch, waarbij de saaie engineering-taken worden afgehandeld zodat mensen zich kunnen concentreren op grote ideeën.

De auteurs benadrukken dat dit open-source is en werkt met alle bestaande AI-agent tools, wat betekent dat je je code niet hoeft te herschrijven om het te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →