Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
Dit artikel introduceert Agent-X, een benchmark op grote schaal met 828 real-world, multimodale taken in zes uiteenlopende omgevingen en een fijnmazig evaluatiekader op stapelniveau om diep redeneren in visie-gecentreerde agenten te beoordelen, waarbij blijkt dat huidige toonaangevende modellen moeite hebben om succes over de volledige keten te behalen in complexe scenario's met meerdere stappen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een super slim robotassistent hebt gebouwd. Je geeft het een camera, een brein en een gereedschapskist vol gadgets (zoals een vergrootglas, een rekenmachine of een webbrowser). Je vraagt het een lastige puzzel op te lossen, zoals: "Vind de goedkoopste vlucht naar Parijs, check het weer daar en vertel me of ik een paraplu nodig heb."
Lange tijd hebben we deze robots getest met simpele, neppe puzzels die lijken op videospelletjes. Maar de echte wereld is rommelig, omvat video's en vereist dat de robot in meerdere stappen denkt, niet slechts in één.
Maak kennis met Agent-X. Denk aan dit paper als het werk van de makers van een nieuwe, ongelooflijk moeilijke "obstakelbaan" die specifiek is ontworpen om te testen hoe goed deze robotassistenten diep kunnen nadenken en hun gereedschappen in de echte wereld kunnen gebruiken.
Hier is de uiteenzetting van wat ze deden, met behulp van alledaagse analogieën:
1. Het Probleem: De "Videospelletjes" versus de "Echte Wereld"
Vorige tests waren als het geven van een videospelletjesniveau aan een robot waar de regels op de muur staan geschreven: "Gebruik de rode sleutel om de blauwe deur te openen." De robot volgt gewoon de instructie.
Maar in het echte leven zegt niemand je welk gereedschap je moet gebruiken. Je zegt gewoon: "Maak de lekkende kraan vast." De robot moet uitzoeken: Heb ik een moersleutel nodig? Moet ik een videotutorial opzoeken? Moet ik een loodgieter bellen?
De auteurs zeggen dat huidige robots lijken op studenten die goed zijn in het memoriseren van antwoorden voor een specifieke toets, maar bevriezen wanneer ze worden gevraagd een probleem op te lossen dat ze nog nooit hebben gezien. Ze worstelen om meerdere denkstappen aan elkaar te koppelen.
2. De Oplossing: De "Agent-X" Obstakelbaan
Het team creëerde Agent-X, een enorme verzameling van 828 uitdagingen uit de echte wereld.
- De Scenario's: In plaats van neppe afbeeldingen gebruikten ze echte foto's, video's en screenshots uit zes verschillende "wijken" van het leven:
- Rijden: Een video van een auto bekijken en uitzoeken of een voetganger op het punt staat over te steken.
- Toezicht: Beveiligingsbeelden bekijken om een verdachte persoon op te sporen.
- Sport: Een wedstrijdvideo analyseren om spelers te tellen of de winnaar te voorspellen.
- Webbrowsen: Een website navigeren om specifieke informatie te vinden zonder precies te worden verteld op welke knoppen je moet klikken.
- Wiskunde & Algemene Logica: Vergelijkingen oplossen die in afbeeldingen staan of meerdere afbeeldingen vergelijken.
- De Twist: De robots krijgen geen checklist. Ze moeten naar de afbeelding kijken, beseffen wat er ontbreekt, het juiste gereedschap uit hun gereedschapskist kiezen, het gebruiken, naar het resultaat kijken en vervolgens beslissen wat ze als volgende moeten doen.
3. De "Scheidsrechter": Hoe Ze de Robots Beoordelen
Dit is het belangrijkste deel. Meestal controleren we gewoon of de robot het juiste eindantwoord heeft (zoals een leraar die een wiskundetoets nakijkt).
Agent-X introduceert een stap-voor-stap scheidsrechter. Stel je een leraar voor die niet alleen naar het eindantwoord kijkt, maar het kladpapier van de student bekijkt.
- Hebben ze het juiste gereedschap gekozen? (Bijvoorbeeld: Hebben ze een rekenmachine gebruikt in plaats van een vergrootglas?)
- Hebben ze het gereedschap correct gebruikt? (Bijvoorbeeld: Hebben ze de cijfers in de juiste volgorde ingetypt?)
- Was hun logica logisch? (Bijvoorbeeld: Hebben ze een conclusie getrokken zonder naar het bewijs te kijken?)
Als een robot het juiste antwoord raadt, maar daar is gekomen door te hallucineren (dingen uit de duim te zuigen) of stappen over te slaan, geeft Agent-X een onvoldoende. Dit is als een chef die een heerlijke taart maakt, maar de verkeerde ingrediënten heeft gebruikt; de taart smaakt goed, maar het proces was gebrekkig.
4. De Resultaten: De Robots Leren Nog Steeds
De auteurs testten 12 van de slimste beschikbare AI-modellen (inclusief grote namen zoals GPT-4, Gemini en Qwen).
Het Vonnis: Zelfs de "slimste" robots worstelen.
- De Score: De beste modellen kregen minder dan 50% van de taken volledig correct van begin tot eind.
- De Bottleneck: De robots zijn goed in het zien van de afbeelding en er over praten, maar ze zijn verschrikkelijk in plannen. Ze doen vaak het volgende:
- Vergeten een gereedschap te gebruiken dat ze nodig hebben.
- Gebruiken een gereedschap dat ze niet hebben (een niet-bestaand gereedschap hallucineren).
- Raak in de war wanneer ze naar een video moeten kijken en moeten volgen wat er in de loop van de tijd gebeurt.
- Verprutsen de opmaak van hun antwoorden (zoals het schrijven van een brief in plaats van het invullen van een formulier).
5. De Conclusie
Het paper concludeert dat hoewel deze AI-agenten indrukwekkend zijn, ze nog niet klaar zijn om volledig autonome werknemers te zijn. Ze lijken op een briljante stagiair die veel feiten kent, maar constant toezicht nodig heeft om uit te zoeken hoe het werk gedaan moet worden.
De auteurs bouwden Agent-X als een "stress-test" die ons precies laat zien waar deze robots falen, zodat onderzoekers de specifieke delen van hun "hersenen" die gaan over plannen en het gebruik van gereedschappen kunnen repareren. Ze vragen niet alleen: "Kun je dit beantwoorden?" Ze vragen: "Kun je hierdoorheen denken?" en tot nu toe is het antwoord: "Nog niet helemaal."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.