MELLON - Multimodal Enhanced LLM for Online Navigation
Het artikel introduceert MELLON, een multimodale framework die de prestaties van web-navigatieagenten op de WebShop-benchmark aanzienlijk verbetert door tekst en afbeeldingen uit te lijnen om redeneren en planning te verbeteren, waarbij een nauwkeurigheidstoename van 9,26% wordt bereikt na slechts één epoch training.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert om over het internet te winkelen. Je zou kunnen denken: "Geef het gewoon de tekstuele instructies, zoals 'koop een rood shirt', en het zal de website lezen en op de knoppen klikken." Maar hier zit de crux: websites zijn niet alleen maar muren van tekst. Het zijn kleurrijke, visuele plekken vol met plaatjes, lay-outs en ontwerpen. Als je een mens vraagt om een specifieke paar schoenen te vinden, lezen ze niet alleen de beschrijving; ze kijken naar de foto om de kleur, de stijl en de vorm te zien. Lange tijd waren de slimste computerprogramma's die probeerden te navigeren op het web als blinde shoppers — ze konden de tekst perfect lezen, maar konden de afbeeldingen niet "zien". Dit artikel bevindt zich in de wereld van Kunstmatige Intelligentie, specifiek gericht op "Web Navigatie Agenten". Dit zijn digitale helpers die ontworig zijn om natuurlijke taalcommando's te begrijpen en taken uit te voeren op echte websites, zoals het kopen van artikelen of het boeken van tickets. De grote vraag die onderzoekers stellen is: Kunnen we deze agenten leren om zowel hun "ogen" (om afbeeldingen te zien) als hun "brein" (om tekst te lezen) tegelijkertijd te gebruiken, net zoals mensen dat doen?
De onderzoekers achter deze studie, werkend aan een project genaamd MELLON, besloten dit idee te testen op een gesimuleerde online winkel genaamd WebShop. Ze wilden zien of het de AI-agent een beter besluit laat nemen door een visuele weergave van de productfoto's, naast de tekstuele beschrijvingen, te geven. Ze gokten niet zomaar; ze bouwden drie verschillende experimentele hulpmiddelen om het puzzelstukje op te lossen. De eerste, en meest succesvolle, was MELLON zelf. Denk aan MELLON als een super slimme shopper die een speciale bril draagt die de visuele wereld vertaalt naar een taal die het brein van de AI kan begrijpen. Het team kwam erachter dat door deze agent voor slechts één ronde leren (één "epoch") te trainen, het aanzienlijk beter werd in zijn taak. Specifiek steeg de nauwkeurigheid bij het voltooien van taken met 9,26% vergeleken met een basisversie die alleen naar tekst keek. Dit suggereert dat het combineren van visie en tekst een krachtige manier is om AI over het web te laten navigeren, zelfs als het systeem nog wat groeipijnen heeft.
Echter, het verhaal is geen simpel "multimodaal is altijd beter" overwinningstocht. Het team probeerde ook twee andere creatieve benaderingen die niet zo goed werkten als gehoopt. Eén idee was om de winkeltaak te behandelen als een "Visual Question Answering"-spel (VQAgent), waarbij de AI naar een plaatje en een vraag kijkt, en dan het juiste antwoord kiest. Ze dachten dat dit zou werken omdat winkelen vergelijkbaar is met het beantwoorden van vragen over afbeeldingen. Maar ze ontdekten dat in de rommelige, echte context van WebShop de tekstuele beschrijvingen eigenlijk belangrijkere aanwijzingen bevatten dan de plaatjes. Omdat de AI getraind was om zwaar op de afbeeldingen te vertrouwen, raakte het in de war wanneer de tekst de werkelijke sleutel tot de oplossing was. Het is als proberen een raadsel op te lossen door naar een tekening te staren terwijl het antwoord in de kleine lettertjes verborgen zit.
De derde poging betrof een "Multimodale Ranker", een hulpmiddel ontworpen om de agent te laten pauzeren en elk item op een pagina zorgvuldig te vergelijken voordat hij een keuze maakt, in plaats van gewoon het eerste dat hij ziet te grijpen. De hoop was dat deze extra bedenktijd zou leiden tot betere resultaten. In plaats daarvan lieten de experimenten zien dat deze extra voorzichtigheid de agent juist langzamer en minder nauwkeurig maakte. De onderzoekers ontdekten dat de hulpmiddelen die gebruikt worden om de gelijkenis tussen afbeeldingen en tekst te meten (genoemd BERT- en CLIP-scores), niet goed overeenkwamen met wat een product in de praktijk een "goede match" maakte in het scoringssysteem van het spel. Het bleek dat proberen elk item te rangschikken als een shopper was die een uur lang elke shirt in de winkel staat te vergelijken, om vervolgens de verkeerde te kopen omdat hij overweldigd raakte.
Dus, wat is de uiteindelijke les uit dit digitale winkelavontuur? Het artikel suggereert dat hoewel het geven van het vermogen om de web te "zien" aan AI-agenten een veelbelovend pad vooruit is, het geen toverstaf is. De MELLON-agent bewees dat het afstemmen van afbeeldingen en tekst de prestaties kan verbeteren, maar de andere experimenten toonden aan dat het simpelweg toevoegen van complexere visuele redenering of het dwingen van de agent om naar alles te kijken, niet altijd de juiste strategie is. De onderzoekers concluderen dat we moeten blijven onderzoeken hoe we de beste manier vinden om deze visuele en tekstuele aanwijzingen te mengen, misschien door de agenten langer te trainen of door in de toekomst nog slimmere "hersenen" (Large Language Models) te gebruiken. Voor nu hebben ze laten zien dat een beetje visie een heel eind komt, maar de AI moet nog leren precies wanneer hij naar de foto moet kijken en wanneer hij de kleine lettertjes moet lezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.