AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning
Het artikel introduceert AliyunConsoleAgent, een kosteneffectief webagent-framework dat bijna staat-van-de-kunst prestaties bereikt bij het verifiëren van cloud console-documentatie door middel van een tweestaps trainingsparadigma dat supervised fine-tuning op gedestilleerde trajecten combineert met reinforcement learning met een robuust beloningssysteem in echte omgevingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de manager bent van een enorm, constant veranderend pretpark (de Cloud Console). Elke dag voegt het pretpark nieuwe attracties toe, verandert het de ticketbalies en werkt het de veiligheidsregels bij. Ondertussen worden de reisgidsen (de Documentatie) geschreven door een ander team dat ze langzaam en met de hand bijwerkt.
Het Probleem:
Omdat het pretpark zo snel verandert, raken de reisgidsen snel verouderd. Een stap in het boek kan zeggen: "Klik op de blauwe knop", maar in het live pretpark is die knop nu rood, of is hij vervangen door een touchscreen. Het controleren van elke individuele instructie in de reisgids tegenover het live pretpark is een nachtmerrie. Het zou een menselijk team miljoenen uren per jaar kosten, en momenteel controleren ze slechts 1% van de instructies. Als ze dit niet doen, raken klanten verdwaald en gefrustreerd.
De Oude Oplossing (en waarom deze faalde):
Het bedrijf probeerde "superintelligente robots" (Frontier Proprietary Models) in te huren om de controle uit te voeren. Deze robots zijn ongelooflijk slim en kunnen de reisgidsen lezen en het pretpark perfect navigeren. Echter, ze zijn duur (alsof je een team van PhD's inhuurt voor elke enkele controle) en riskant (je moet hen je privé landkaarten laten zien, wat de beveiligingsregels schendt). Je kunt het je niet veroorloven om ze te gebruiken voor de miljoenen controles die nodig zijn.
De Nieuwe Oplossing: AliyunConsoleAgent
De auteurs hebben hun eigen "trainbare robot" gebouwd (een AI-model met 32 miljard parameters) die goedkoper en veiliger is om op hun eigen servers te draaien. Maar een standaard robot is niet slim genoeg om met een chaotisch, veranderend pretpark om te gaan. Daarom gebruikten ze een tweestaps-trainingsmethode:
1. De "Shadowing" Fase (Supervised Fine-Tuning)
Eerst namen ze de superintelligente robots en lieten ze de nieuwe robot hen schaduwen.
- De Analogie: Stel je een meesterkok (de super-robot) voor die een complex gerecht bereidt. De nieuwe robot kijkt naar de meester en onthoudt elke snij-, roer- en kruidstap.
- Het Resultaat: De nieuwe robot leert de basis van hoe hij door het pretpark moet navigeren en instructies moet opvolgen. Hij wordt best goed, maar hij is slechts aan het kopiëren. Als het pretpark licht verandert, raakt hij in de war omdat hij de opdracht niet echt begrijpt, hij onthoudt alleen de stappen.
2. De "Trial and Error" Fase (Reinforcement Learning)
Vervolgens lieten ze de robot los in een gesimuleerde versie van het pretpark om te leren door te doen.
- De Uitdaging: In een echte cloudomgeving faalt de robot vaak niet omdat hij dom is, maar omdat de "parkomgeving" nog niet klaar is. Bijvoorbeeld: hij probeert een server te verwijderen, maar die server bestaat nog niet. Als de robot hiervoor gestraft wordt, leert hij de verkeerde les (dat hij slecht is in het verwijderen van servers) in plaats van de juiste les (dat hij eerst de server moet bouen).
- De Fix (De High-Determinism Rollout): Het team heeft een speciale "trainingsgrond" gebouwd met behulp van Terraform (een tool die infrastructuur bouwt zoals Lego). Voordat de robot een taak probeert uit te voeren, bouwt dit systeem automatisch de exacte vereisten (zoals het bouwen van de server, het instellen van het netwerk), zodat de robot kan slagen als hij de juiste stappen zet.
- Het Beloningssysteem: In plaats van een mens die de robot beoordeelt, gebruiken ze een Dual-Channel Judge:
- De Regelcontroleur: Deze kijkt naar de officiële "audit logs" (de beveiligingscamera-beelden van het pretpark) om te zien of de actie daadwerkelijk heeft plaatsgevonden. Is de server verwijderd? Ja/Nee. Dit is 100% objectief.
- Het Panel van Rechters: Als er geen duidelijke log is, fungeren twee andere AI-modellen als rechters. Ze geven alleen een "pass" als ze beiden ermee instemmen dat de robot geslaagd is. Dit voorkomt dat de robot de "rechters" kan bedriegen of foppen.
Het Resultaat
Na deze training evolueerde de robot van een hersenloze volger naar een autonome probleemoplosser.
- Vóór: Als de gids zei "Zet automatisch verlengen uit" maar de schakelaar stond al uit, zou de robot gewoon stoppen en zeggen: "Ik kan het niet doen."
- Na: De robot denkt: "Wacht, ik kan het niet uitzetten als het al uit staat. Ik moet het eerst aanzetten, zodat ik het daarna kan uitzetten om te bewijzen dat ik het gedaan heb." Hij begreep de logica uit zichzelf.
De Kern van het Verhaal:
- Prestaties: Hun nieuwe robot (AliyunConsoleAgent-32B) is bijna net zo goed als de dure "super-robots" (binnen een verschil van 1,8%).
- Kosten: Het kost 92% minder om te draaien.
- Impact: Ze hebben dit systeem gebruikt om meer dan 54.000 instructies te auditeren en vonden bijna 4.400 echte fouten die productteams hebben gecorrigeerd.
Kortom, ze hebben een lokale, betaalbare robot geleerd om als een genie te denken door hem een genie te laten schaduwen, en hem vervolgens te laten oefenen in een perfect voorbereide trainingsgym waar hij kon leren van zijn fouten zonder gestraft te worden voor zaken die buiten zijn controle lagen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.