WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
Het artikel introduceert WikiVQABench, een door mensen samengesteld benchmark dat Wikipedia-afbeeldingen, bijschriften en Wikidata combineert om de kennisgebaseerde redeneercapaciteiten van visueel-taalmodellen te evalueren via meerkeuzevragen die externe informatie vereisen die verder gaat dan visuele waarneming.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een spelletje "Raad de afbeelding" speelt met een vriend. Meestal is het spel eenvoudig: je toont een foto van een rode appel en je vriend zegt: "Dat is een appel!" of "Het is rond!" Zo werken de meeste huidige AI-visiontests. Ze controleren of de AI kan zien wat er op de foto staat.
Maar in de echte wereld is kijken niet altijd genoeg. Stel je voor dat je je vriend een foto toont van een zeer specifieke, zeldzame spin. Als je vraagt: "Tot welke spinnenfamilie behoort deze?", kan je vriend niet alleen door naar het web of de poten te kijken, het antwoord geven. Ze moeten biologische feiten kennen die niet zichtbaar zijn op de foto. Ze moeten informatie halen uit de "bibliotheek" van kennis in hun brein.
WikiVQABench is een nieuwe test die is ontworpen om te zien of AI precies dat kan doen: wat het ziet combineren met wat het weet uit een bibliotheek van feiten.
Hieronder wordt uitgelegd hoe het artikel dit uitlegt, opgesplitst in eenvoudige onderdelen:
1. Het probleem: AI is te "oppervlakkig"
Huidige AI-modellen zijn uitstekend in het beschrijven van wat direct voor hen ligt (zoals "een man die een knuppel vasthoudt"). Maar ze hebben moeite wanneer een vraag externe kennis vereist.
- De oude manier: Toon een foto van een bezienswaardigheid en vraag: "Wat is dit?" (Antwoord: "Een hoge stenen toren.")
- De nieuwe uitdaging: Toon dezelfde foto en vraag: "Welke oude beschaving heeft dit gebouwd?" (Antwoord: "De Feniciërs.") Je kunt "Feniciërs" niet in de steen zien; je moet de geschiedenis kennen.
2. De oplossing: Een "bibliotheek-gekoppelde" test
De onderzoekers hebben een nieuwe test gebouwd die WikiVQABench heet. Denk hierbij aan een quiz waarbij elke vraag is gekoppeld aan een specifieke pagina in een enorme encyclopedie (Wikipedia) en een gestructureerde database van feiten (Wikidata).
- De ingrediënten: Ze namen echte foto's van Wikipedia, lazen de artikelen ernaast en haalden gestructureerde feiten uit Wikidata (zoals een digitaal archief van feiten).
- Het recept: Ze gebruikten een slim computerprogramma (een LLM) om deze ingrediënten te mengen en meerkeuzevragen te creëren.
- De menselijke touch: Dit is het belangrijkste onderdeel. De computer maakte duizenden vragen, maar maakte fouten. Dus fungeerden echte mensen als "redacteuren". Ze controleerden elke enkele vraag om ervoor te zorgen dat:
- Het antwoord daadwerkelijk waar is.
- De vraag overeenkomt met de afbeelding.
- Cruciaal: Je de vraag niet alleen door naar de afbeelding te kijken kunt beantwoorden. Je moet externe kennis gebruiken.
3. De test: "De kennislacune"
De onderzoekers testten 15 verschillende AI-modellen op deze nieuwe quiz. Deze modellen varieerden van kleine (zoals een zakrekenmachine) tot enorme modellen (zoals een supercomputer).
De resultaten:
- Het grote gat: De beste AI haalde ongeveer 76% correct. De kleinste AI haalde slechts 25% correct (wat in feite willekeurig gokken is).
- De realiteitscheck: Zelfs de grootste, slimste AI haalde niet 100%. Dit bewijst dat de test moeilijk is en dat huidige AI nog steeds worstelt met het perfect combineren van "zien" met "weten".
- Grootte telt (maar niet alles): Grotere modellen deden over het algemeen beter, maar alleen een model groter maken maakte het niet automatisch een genie in dit specifieke type redeneren.
4. Waarom dit belangrijk is
Denk aan deze benchmark als een "rijbewijstest" voor AI.
- Oude tests: Controleerden of de AI het stuur en de weg kon zien.
- WikiVQABench: Controleert of de AI de verkeersregels, de geschiedenis van de weg en de regels van de stad kent, niet alleen hoe de weg eruitziet.
Het artikel concludeert dat we tests zoals deze nodig hebben om de "blinde vlekken" in AI te vinden. Het toont aan dat AI, terwijl het beter wordt in zien, nog veel beter moet worden in het begrijpen van de wereld achter de afbeelding. De onderzoekers hebben deze test en de data beschikbaar gesteld voor iedereen om te gebruiken, in de hoop dat dit helpt bij het bouwen van slimmere, meer kennisrijke AI in de toekomst.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.