← Nieuwste papers
🤖 AI

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO is een nieuw framework dat tool-gebruikende agenten verbetert door een gestructureerde reflectieve data-engine voor warm-starting te combineren met een reflectie-geaugmenteerd Group Relative Policy Optimization-algoritme, waardoor agenten effectief kunnen leren van bijna-fouten en gezamenlijk reflectietokens en corrigerende acties kunnen optimaliseren om bestaande baselines te overtreffen.

Oorspronkelijke auteurs: Binjie Zhang, Mike Zheng Shou

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Binjie Zhang, Mike Zheng Shou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme maar licht onhandige robotassistent leert om complexe puzzels op te lossen met een gereedschapskist vol digitale gadgets (zoals webzoeken, beeldlezers of code-executors). Deze robot is een "Vision-Language Model", wat betekent dat hij afbeeldingen kan zien en tekst kan lezen, maar dat hij soms fouten maakt wanneer hij probeert deze tools te gebruiken.

Dit artikel introduceert een nieuwe trainingsmethode genaamd ReGRPO (Reflection-Augmented Group Relative Policy Optimization). Zo werkt het, uitgelegd aan de hand van eenvoudige analogieën:

Het Probleem: De Robot die Niet Weet Hoe Fouten te Herstellen

Momenteel, wanneer we deze robots trainen, laten we ze vooral perfecte voorbeelden zien van hoe een taak wordt uitgevoerd. Het is alsof je een student alleen het antwoordenblad laat zien waar elke stap correct is uitgevoerd.

  • Het Probleem: Als de robot probeert een tool te gebruiken en faalt (bijvoorbeeld, hij probeert een bonnetje te lezen maar de camerahoek is verkeerd, waardoor hij niets ziet), weet hij niet wat hij moet doen. Hij gaat dan blind door of geeft op.
  • De Kloof: Oude trainingsmethoden leren de robot niet hoe hij moet herstellen van een fout. Ze leren hem alleen hoe hij moet slagen wanneer alles goed gaat.

De Oplossing: De "Error-Reflection-Correction" Lus

De auteurs hebben een nieuw systeem ontwikkeld dat de robot leert om te pauzeren, na te denken en zichzelf te corrigeren. Ze noemen dit Reflectie (Reflection).

Denk hierbij aan een GPS-navigatiesysteem:

  1. De Fout (Bijna-incident): De robot probeert een afslag te nemen, maar de weg is geblokkeerd (de tool faalt).
  2. De Reflectie (Het "Aha!"-moment): In plaats van simpelweg te crashen, stopt de robot en vraagt: "Waarom is dit mislukt? Oh, ik heb geprobeerd de tekst op het verkeerde deel van de afbeelding te lezen. Het bewijs is dat de tekst leeg is. Mijn plan is om het cameravak naar rechts te verplaatsen."
  3. De Correctie: De robot probeert direct het nieuwe plan en slaagt.

Hoe Ze Het Gebouwd Hebben (De "Gestructureerde Data-engine")

Om de robot deze vaardigheid te leren, hebben de onderzoekers niet alleen gewacht tot hij vanzelf zou falen. Ze hebben een simulatie-laboratorium gebouwd:

  • Ze namen een perfecte taak en maakten deze opzettelijk kapot (bijvoorbeeld, ze vertelden de robot om naar het verkeerde deel van een foto te kijken).
  • Ze keken hoe de robot faalde en noteerden precies wat er misging.
  • Ze gebruikten een "Teacher AI" (een zeer intelligent model) om een gestructureerde notitie voor de robot te schrijven. Deze notitie heeft drie specifieke onderdelen:
    1. Felijkheidstype: Wat voor soort fout was het? (bijv. "Ik keek naar de verkeerde plek.")
    2. Bewijs: Wat bewijst dat? (bijv. "De tekst die ik las was leeg.")
    3. Herstelplan: Hoe los ik het op? (bijv. "Verplaats het cameravak naar de tekst.")
  • Ze lieten de robot vervolgens deze "Fout + Notitie + Herstel"-sequentie keer op keer oefenen totdat hij leerde dit automatisch te doen.

Het Trainingsspel (Group Relative Policy Optimization)

Zodra de robot de basis onder de knie had, lieten ze hem meedoen aan een trainingsspel om nog beter te worden.

  • Het Spel: Ze vragen de robot om dezelfde puzzel 10 keer op te lossen.
  • De Score: Soms slaagt hij direct. Andere keren faalt hij, pauzeert om te "reflecteren" en herstelt het dan.
  • De Beloning: De robot krijgt punten voor het oplossen van de puzzel, maar hij verliest een paar punten als hij onnodig veel tijd besteedt aan "nadenken" (reflecteren).
  • Het Doel: De robot leert om alleen te stoppen en te reflecteren wanneer het echt nodig is, en om zijn reflecties kort en nuttig te houden. Hij leert zijn eigen pogingen te vergelijken: "Hé, de versie waarbij ik reflecteerde en het herstelde, kreeg meer punten dan de versie waarbij ik gewoon blind doorging."

Het Resultaat: Een Slimere, Zelfherstellende Robot

De onderzoekers testten deze nieuwe robot (ReGRPO) op twee moeilijke uitdagingen:

  1. GTA: Taken die het lezen van bonnetjes, grafieken en UI-schermen omvatten.
  2. GAIA: Taken die complexe documenten zoals PDF's en spreadsheets omvatten.

De Uitkomst:

  • De nieuwe robot was aanzienlijk beter in het oplossen van deze taken dan eerdere open-source robots.
  • Hij werd niet alleen beter in het gebruiken van tools; hij werd ook beter in het herstellen wanneer tools faalden.
  • Cruciaal is dat hij leerde dit te doen zonder dat er een mens of een tweede computer nodig was om zijn werk te controleren tijdens de uiteindelijke test. Hij leerde te vertrouwen op zijn eigen "reflectie" om fouten on the fly te herstellen.

Samenvatting

Kortom, dit artikel leert AI-agenten om te zijn als een zelfcorrigerende monteur. In plaats van alleen te weten hoe je een auto perfect moet besturen, leert de monteur hoe hij een vreemd geluid moet horen, het probleem moet diagnosticeren en het direct moet repareren, zonder de auto te stoppen om een supervisor te bellen. Dit maakt de AI veel betrouwbaarder in de echte wereld, waar zaken niet altijd volgens plan verlopen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →