VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
Het artikel introduceert VKnowU, een uitgebreide benchmark voor het evalueren van visueel kennisbegrip in Multimodale Grote Taalmodellen, en stelt VideoKnow+ voor, een op reinforcement learning gebaseerd model dat de prestaties op deze benchmark en andere video-begriptaken aanzienlijk verbetert door expliciet gestructureerde visuele kennis te integreren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme robotvriend hebt die video's kan bekijken en vragen erover kan beantwoorden. Al een lange tijd is deze robot erg goed in het herkennen van dingen. Als je hem een video laat zien van een hond die een bal achtervolgt, kan hij je vertellen: "Dat is een hond," "Dat is een bal," en "De hond rent."
Maar er is een probleem: de robot begrijpt de wereld niet echt zoals mensen dat doen. Hij weet niet intuïtief dat als je een bal laat vallen, deze naar beneden zal vallen (zwaartekracht), of dat een glazen beker breekbaar is en kan breken als je hem laat vallen, of dat een persoon die fronsend kijkt waarschijnlijk verdrietig is. Hij ziet de pixels, maar hij mist het "gezond verstand" dat erachter schuilgaat.
Dit artikel introduceert een nieuwe manier om robots te testen en te leren over dit ontbrekende "gezonde verstand", wat de auteurs Visuele Kennis noemen.
Het Probleem: De Robot is "Blind" voor Gezond Verstand
De auteurs hebben een enorme test gemaakt genaamd VKnowU (Visual Knowledge Understanding). Zie dit als een eindexamen voor robots, maar in plaats van wiskunde of geschiedenis, gaan de vragen over hoe de wereld werkt en hoe mensen denken.
De test is verdeeld in twee hoofdonderwerpen:
- Wereldgericht (De Natuurkundeles): Weet de robot dat een zware doos moeilijker op te tillen is dan een veer? Weet hij dat een muntje op de grond zal vallen?
- Mensgericht (De Psychologieles): Begrijpt de robot dat een jongen die naar een rommelige kamer kijkt, misschien van plan is om een nog grotere bende te maken? Weet hij dat als volwassenen binnenkomen, ze geschokt kunnen zijn?
De Resultaten: Toen ze deze test voorlegden aan de slimste beschikbare robots (zoals die van Google, OpenAI en open-source teams), scoorden de robots slecht. Ze waren vooral slecht in de "Natuurkundeles". Ze konden de scène perfect beschrijven, maar faalden in het voorspellen van wat er daarna zou gebeuren of het begrijpen van de materialen van objecten. Ze "zagen" wel, maar "begrepen" niet.
De Oplossing: De Robot Leren om te "Zien, Denken, Antwoorden"
Om dit op te lossen, hebben de auteurs een nieuwe trainingsmethode gebouwd genaamd VideoKnow+. Ze realiseerden zich dat robots probeerden antwoorden te raden op basis van hun taaltraining (zoals het raden van het antwoord op een raadsel zonder naar de afbeelding te kijken).
Ze introduceerden een nieuwe regel voor de robot: "Zien, Denken, Antwoorden."
- Zien: Voordat de robot antwoord geeft, moet hij eerst precies beschrijven wat hij in de video ziet, met de focus op de visuele aanwijzingen.
- Denken: Daarna gebruikt hij die visuele aanwijzingen om te redeneren.
- Antwoorden: Ten slotte geeft hij het antwoord.
Ze creëerden ook een speciaal "beloningssysteem". Stel je een leraar voor die de robot beoordeelt. Als de robot probeert het antwoord te raden met alleen woorden, geeft de leraar een lage score. Maar als de robot een beschrijving schrijft die bewijst dat hij het visuele bewijs heeft gezien (zoals "De doos is van hout, dus hij is zwaar"), geeft de leraar een hoge score. Dit dwingt de robot om echt aandacht te besteden aan de video, in plaats van alleen aan zijn interne database met feiten.
De Uitkomst
Na training met deze nieuwe methode en een enorme nieuwe dataset van video's (genaamd VKnowQA), werd de robot veel beter.
- Hij verbeterde zijn score op de "Visuele Kennis"-test met een aanzienlijke marge.
- Hij werd ook beter in andere algemene videotests, wat bewees dat het leren begrijpen van de wereld hem helpt op veel verschillende gebieden.
Het Grotere Plaatje
Het artikel betoogt dat voor robots om echt intelligent te worden, ze moeten stoppen met alleen "patroonherkenning" (het herkennen van objecten) en moeten beginnen met "wereldbegrip". Net zoals een menselijk kind leert dat vuur heet is en glas breekbaar is door de wereld te observeren, moeten robots deze "visuele waarheden" leren om de kloof te overbruggen tussen simpelweg een afbeelding zien en echt begrijpen wat er in die afbeelding gebeurt.
Kortom: Het artikel bouwde een test om aan te tonen dat robots slecht zijn in gezond verstand, en bouwde vervolgens een nieuwe trainingsmethode die hen dwingt om naar het bewijs te kijken voordat ze gokken, waardoor ze veel slimmer en betrouwbaarder worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.