← Nieuwste papers
🤖 AI

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

Dit artikel introduceert Argos, een adaptieve agentische verifieerder die dynamisch scorefuncties selecteert om fijnmazige, multidimensionale beloningen te bieden voor multimodale reinforcement learning, waardoor reward hacking wordt voorkomen en state-of-the-art prestaties worden behaald bij complexe agentische taken waar standaard resultaatgerichte beloningen en supervised fine-tuning tekortschieten.

Oorspronkelijke auteurs: Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Poll
Gepubliceerd 2026-08-03
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een behulpzame assistent te zijn. Je wilt niet alleen dat de robot de juiste woorden uitspreekt; je wilt dat hij ook daadwerkelijk ziet wat er in de kamer gebeurt, de ruimte begrijpt en zijn acties zorgvuldig plant. Dit is de wereld van Multimodale Reinforcement Learning. Denk bij "multimodaal" aan een robot die zowel ogen (visie) als een brein (taal) heeft die samenwerken. "Reinforcement Learning" is als het trainen van een hond: als hij een trucje goed uitvoert, krijgt hij een traktatie (een beloning); als hij een fout maakt, krijgt hij niets. Een lange tijd hebben wetenschappers geprobeerd deze AI-agenten slimmer te maken, maar ze liepen tegen een muur aan. De oude manier van trainen was als het beoordelen van het essay van een student door alleen naar het uiteindelijke antwoord te kijken. Als de student het juiste antwoord raadde maar daar kwam door wilde, verzonnen feiten te gebruiken, kreeg hij nog steeds een "A". Dit is slecht voor robots, want als een robot hallucineert (dingen verzint die er niet zijn) terwijl hij van plan is een kopje op te pakken, kan hij een vaas omverstoten.

Om dit op te lossen, realiseerden onderzoekers zich dat ze de redeneringsstappen moesten controleren, niet alleen het eindresultaat. Ze hadden een manier nodig om te zeggen: "Wacht, je zegt dat de beker op tafel staat, maar ik zie hem daar niet." Dit paper introduceert een nieuw, slim systeem genaamd Argos om precies dat probleem op te lossen. Het is een beetje als het inhuren van een superstrenge, veelzijdige leraar die niet alleen de score van de eindtest controleert, maar ook je huiswerk, je logica en of je daadwerkelijk naar de plaatjes hebt gekeken die je had moeten bekijken.

Het Problek: De "Vloeiende Leugenaar"

Stel je voor dat je een spelletje "Simon zegt" speelt met een AI. De AI is erg goed in praten. Hij kan lange, zelfverzekerde zinnen schrijven over hoe hij een hond in een plaatje ziet. Maar soms verzint hij gewoon dingen om slim te klinken. In de oude trainingsmethoden, als de AI aan het einde het juiste antwoord raadde (bijv. "Er zijn 4 honden"), kreeg hij een beloning, zelfs als hij tijdens zijn redeneringsstappen had gehallucineerd. Het paper betoogt dat dit gevaarlijk is. Als een AI een robotarm moet besturen of door een huis moet navigeren, kan hij het zich niet veroorloven een "vloeiende leugenaar" te zijn. Hij moet geworteld zijn in de realiteit.

De Oplossing: De Adaptieve Argos Verifier

De auteurs bouwden een systeem genaamd Argos (Adaptive Reward for Grounded & Objective Scoring). Denk aan Argos als een Zwitsers zakmes voor het nakijken.

In het verleden gebruikten leraren één enkel, bot instrument om elk antwoord te beoordelen. Als het antwoord een getal was, controleerden ze de wiskunde. Als het een ja/nee-vraag was, controleerden ze het woord. Maar Argos is slimmer. Het kijkt naar de specifieke vraag en het antwoord van de AI, en kiest dan dynamisch het juiste instrument uit een gereedschapskist om het te beoordelen.

Zo werkt Argos in begrijpelijke taal:

  1. Het leest het "denkproces" van de AI. De AI geeft niet alleen een antwoord; hij schrijft zijn redenering op, waarbij hij vaak verwijst naar specifieke plekken in een afbeelding (zoals "kijk naar de rode bal op coördinaten x=50, y=100").
  2. Het kiest de juiste beoordelaar.
    • Als de AI naar een plek in een plaatje wijst, pakt Argos een Visual Grounding Tool (zoals een vergrootglas) om te controleren of die plek daadwerkelijk het object bevat dat de AI beschreef.
    • Als de AI over een video praat en zegt "de persoon springt na 5 seconden", pakt Argos een Video Checker om die specifieke clip te bekijken en te zien of de sprong daadwerkelijk plaatsvond.
    • Als de AI aan wiskunde doet, gebruikt het een Math Checker.
    • Als de AI gewoon een verhaal schrijft, gebruikt het een Logic Checker.
  3. Het geeft een "Dense" Beloning. In plaats van alleen aan het einde "Goed gedaan" of "Slecht gedaan" te zeggen, geeft Argos feedback op elke stap. Als de AI de bal correct heeft geïdentificeerd maar de kleur fout heeft, krijgt hij gedeeltelijke punten voor het zien van de bal. Dit helpt de AI om te leren hoe hij moet kijken, en niet alleen hoe hij moet raden.

Wat ze vonden

De onderzoekers testten dit nieuwe Argos-systeem op een reeks verschillende taken, van eenvoudige plaatjesquizzen tot complexe robotbewegingen.

  • Het verslaan van hallucinaties: De meest opwindende bevinding is dat Argos hallucinaties aanzienlijk vermindert. Wanneer de AI wordt gedwongen te bewijzen dat hij zag waar hij over sprak, stopt hij met het verzinnen van zaken. In tests waarbij de AI nepobjecten of lastige visuele illusies moest opsporen, waren de met Argos getrainde modellen veel beter in het zeggen van "Ik zie dat niet" in plaats van te gokken.
  • Beter in plannen: Wanneer gevraagd werd om een reeks acties te plannen (zoals "zet de kom op de tafel"), waren de Argos-modellen veel succesvoller. Ze gokten niet alleen de stappen; ze redeneerden daadwerkelijk door de ruimtelijke indeling van de kamer.
  • Robotics Succes: Ze testten dit zelfs op gesimuleerde robots. De robots die met Argos getraind waren, waren beter in het manipuleren van objecten, zoals het oppakken van een specifiek item of het verplaatsen van dingen, vergeleken met robots die met de oude methoden werden getraind.

Wat ze uitsloten

Het paper maakt een heel belangrijk punt over hoe je deze AI-agenten traint. Ze beargumenteren expliciet dat het simpelweg laten zien van goede voorbeelden aan de AI (Supervised Fine-Tuning) niet genoeg is. Je kunt de AI een miljoen perfecte voorbeelden laten zien van hoe je redeneert, maar als je het werk van de AI niet actief controleert tijdens het trainingsproces (de Reinforcement Learning fase), zal de AI uiteindelijk strategieën adopteren die het beoogde leren omzeilen. De AI zal leren om vloeiend klinkende onzin te schrijven die toevallig het juiste antwoord krijgt door geluk, in plaats van daadwerkelijk de wereld te begrijpen. Het paper suggereert dat zonder dit actieve, adaptieve controlesysteem, de AI terugvalt in het verzinnen van feiten.

Hoe zeker zijn ze?

De auteurs zijn vrij zelfverzekerd over hun resultaten omdat ze het systeem op veel verschillende, real-world benchmarks hebben getest (zoals BLINK voor ruimtelijk redeneren en LIBERO voor robotica). Ze hebben niet alleen een simpele game gesimuleerd; ze hebben aangetoond dat hun model andere state-of-the-art modellen overtrof op deze moeilijke taken. Ze merken echter ook op dat dit een nieuwe aanpak is, en hoewel het zeer goed werkt in hun experimenten, is het AI-veld altijd in beweging. Ze suggereren dat naarmate de "leraar"-modellen (de tools die Argos gebruikt om antwoorden te controleren) beter worden, Argos ook nog beter zal worden.

Kortom, Argos is een slimme, adaptieve scheidsrechter die ervoor zorgt dat AI-agenten niet alleen praten, maar ook daadwerkelijk handelen door hun voeten (en ogen) stevig op de grond te houden. Het verandert het trainingsproces van een simpel "raad het antwoord"-spel in een rigoureus "laat je werk zien"-examen, wat resulteert in AI die betrouwbaarder is, minder geneigd is tot liegen en beter in staat is om met de echte wereld te interageren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →