← Nieuwste papers
🤖 AI

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

RollArt is een gedisaggregeerd multi-task agentisch RL-systeem dat de trainingsdoorvoer en schaalbaarheid optimaliseert door pipeline-stadia toe te wijzen aan gespecialiseerde hardware, traject-niveau interacties te ontkoppelen om synchronisatie-bottlenecks te elimineren, en rollouts te overlappen met training via asynchrone gewichtsupdates, waarmee tot 2,05× snellere trainingstijden op grootschalige clusters wordt bereikt.

Oorspronkelijke auteurs: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng
Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar zeer specifieke robot (een AI) probeert te leren hoe hij complexe problemen moet oplossen, zoals het schrijven van softwarecode of het navigeren op een website. Om dit te doen, geef je hem niet alleen een tekstboek; je laat hem oefenen in een realistische simulatie. Dit proces wordt Agentic Reinforcement Learning genoemd.

De paper introduceert een nieuw systeem genaamd ROLLART dat fungeert als een super-efficiënte verkeersregelaar voor dit trainingsproces. Zo werkt het, met behulp van eenvoudige analogieën.

Het Probleem: De "One-Size-Fits-All" Filesituatie

Stel je een fabriek voor waar één enkel team van arbeiders drie zeer verschillende taken moet uitvoeren:

  1. Denken: Moeilijke wiskundige problemen oplossen (vereist een snel brein).
  2. Lezen: Snel lange boeken lezen (vereist snelle ogen).
  3. Bouwen: Fysieke onderdelen assembleren (vereist sterke handen).

In oudere systemen gebruikte iedereen hetzelfde type arbeider voor alles. Als je een "snel brein"-arbeider aan "lezen" toewees, waren ze traag. Als je een "sterke hand"-arbeider aan "wiskunde" toewees, waren ze traag. Bovendien, als één arbeider vast kwam te zitten bij het repareren van een kapot speelgoedje (een "straggler"), moest de hele fabriek stoppen en op hen wachten voordat er naar de volgende stap kon worden gegaan. Dit veroorzaakte enorme vertragingen.

De Oplossing: ROLLART's Gespecialiseerde Assemblagelijn

ROLLART lost dit op door de fabriek op te delen in gespecialiseerde zones en verschillende teams op hun eigen tempo te laten werken.

1. Werkers Matchen aan de Juiste Gereedschappen (Hardware Affinity)

Het systeem beseft dat sommige taken rekenkracht nodig hebben (zoals het oplossen van wiskunde) en andere taken geheugensnelheid (zoals het lezen van lange teksten).

  • De Oude Manier: Iedereen gebruikte dezelfde dure, zware computer.
  • De ROLLART-Manier: Het stuurt de "wiskunde"-taken naar super-snelle computers en de "lees"-taken naar computers met een enorme, snelle geheugencapaciteit. Het is alsof je een chef naar een keuken stuurt met een krachtig fornuis en een bibliothecaris naar een bibliotheek met een enorme, snelle kaartcatalogus. Ze krijgen de klus sneller gedaan omdat ze het juiste gereedschap gebruiken voor de klus.

2. Werkers hun Eigen Tempo Laten Bepalen (Trajectory-Level Asynchrony)

In de oude fabriek, als één arbeider 10 minuten nodig had voor een taak terwijl anderen 1 minuut nodig hadden, stond de hele lijn 10 minuten stil.

  • De ROLLART-Manier: Het behandelt elke individuele oefenronde (een "trajectory") als een onafhankelijk project. Als één robot vastloopt op een moeilijke puzzel, blijven de andere robots aan hun eigen puzzels werken. Het systeem wacht niet op de trage eenheid; het houdt de snelle eenheden gewoon in beweging. Zodra de trage eenheid eindelijk klaar is, wordt deze beoordeeld, en de snelle eenheden gaan door naar nieuwe taken.

3. "Gig Workers" Inzetten voor Simpele Taken (Serverless Offloading)

Nadat een robot een taak heeft voltooid, moet iemand deze beoordelen. Soms is dit een simpele controle (zoals "is de deur geopend?"), en soms is het een complexe beoordeling door een andere AI.

  • De Oude Manier: Je hield een team van dure, krachtige computers stand-by terwijl ze niets deden, wachtend om deze simpele taken te beoordelen. Het was duur om ze "stand-by" te houden, zelfs als ze niet werkten.
  • De ROLLART-Manier: Het maakt gebruik van "gig workers" (serverless cloud computing). Je betaalt alleen voor de beoordeling wanneer deze daadwerkelijk plaatsvindt. Als er niemand beoordeelt, betaal je niets. Dit bevrijdt de dure computers om zich te concentreren op het zware werk van het onderwijzen van de robot.

4. Leren Terwijl Men Leert (Bounded-Staleness Training)

Normaal gesproken werken de leraar (de trainingscomputer) en de leerling (de robot die oefent) om de beurt. De leerling oefent, stopt, wacht tot de leraar zijn kennis bijwerkt, en begint dan weer.

  • De ROLLART-Manier: De leraar en de leerling werken tegelijkertijd. De leerling blijft oefenen met de kennis van de leraar van "gisteren", terwijl de leraar bezig is met het bijwerken van de kennis van "vandaag". Het systeem zorgt ervoor dat de leerling niet te ver achterloopt (met een "staleness bound"), maar ze hoeven nooit te stoppen om te wachten. Het is als een coach die nieuwe instructies roept naar een hardloper terwijl de hardloper al aan het sprinten is, in plaats van de hardloper bij de startlijn te laten stoppen elke keer als de coach een nieuwe tip heeft.

De Resultaten

De paper testte dit systeem op een enorme schaal (met meer dan 3.000 computers bij Alibaba).

  • Snelheid: Het maakte het trainingsproces 1,3 tot 2 keer sneller dan eerdere methoden.
  • Efficiëntie: Het stopte met het verspillen van dure computerkracht aan stationaire taken.
  • Stabiliteit: Het bewees dat het systeem zelfs wanneer er dingen misgaan (zoals een computer die crasht of een taak die te lang duurt), blijft draaien zonder te breken.

Kortom, ROLLART is een slimme manager die het "wachtspel" tijdens AI-training stopt. Het plaatst de juiste taken op de juiste computers, laat snelle werkers doorgaan zelfs als trage werkers achterblijven, en gebruikt goedkope hulp op aanvraag voor simpele klusjes, wat resulteert in een veel snellere en goedkopere manier om geavanceerde AI te trainen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →