On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
Dit artikel identificeert en kwantificeert "cultureel anachronisme" — de neiging van Vision-Language-modellen om historische artefacten te interpreteren met concepten die temporair ongepast zijn — door de TAB-VLM-benchmark te introduceren, die aanzienlijke prestatiekloven blootlegt in state-of-the-art-modellen bij het redeneren over Indiaas cultureel erfgoed.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een tijdmachine hebt die naar een oud object kan kijken en je zijn verhaal kan vertellen. Je zou verwachten dat het een perfecte historicus is, toch? Nou, dit paper introduceert een nieuw soort "tijdmachine" genaamd een Vision-Language Model (VLM) en ontdekt dat hoewel deze AI-systemen uitstekend zijn in het beschrijven hoe dingen er vandaag uitzien, ze vreselijk zijn in het begrijpen wanneer dingen in het verleden hebben plaatsgevonden.
Hier is de uiteenzetting van de bevindingen uit het paper, uitgelegd met eenvoudige analogieën.
Het Probleem: De "Tijdreizende Kleerkast"
De auteurs noemen het hoofdprobleem Cultureel Anachronisme.
Stel je het zo voor: stel je voor dat je naar een foto kijkt van een oermens die een stenen bijl vasthoudt. Een menselijke historicus weet: "Dat is een stenen bijl van 10.000 jaar geleden; ze hadden nog geen metaal."
Maar de AI in deze studie gedraagt zich als een verwarde tijdreiziger die zojuist uit een modern warenhuis is gekomen. Het zou naar die stenen bijl kunnen kijken en zeggen: "Oh, dat is een high-tech polymeer composiet gereedschap!" of "Dat is gemaakt met een industriële draaibank uit de 19e eeuw!"
De AI verwart tijdsperiodes. Het neemt concepten, materialen en stijlen uit de moderne tijd (of zelfs de 1800-er jaren) en plakt ze op oude objecten. Het is alsof je een neon LED-jas draagt naar een middeleeuws banket; de AI beseft gewoon niet dat de outfit niet bij het tijdperk past.
De Test: TAB-VLM (De "Geschiedenisquiz")
Om dit te bewijzen, bouwden de onderzoekers een speciale test genaamd TAB-VLM.
- De Opzet: Ze verzamelden 1.600 echte artefacten uit de Indiase geschiedenis, variërend van prehistorische stenen werktuigen tot moderne voorwerpen.
- De Vragen: Ze creëerden 600 meerkeuzevragen. In plaats van alleen te vragen "Wat is dit?", stelden ze lastige tijdgebonden vragen zoals:
- "Zet deze vier objecten in volgorde van oudst naar nieuwst."
- "Welk van deze vier objecten hoort niet bij deze tijdsperiode?"
- "Kon deze oude munt van plastic zijn gemaakt?" (Het antwoord is natuurlijk nee, maar de AI zegt soms ja).
De Resultaten: De AI zat vast in het Heden
De onderzoekers testten 10 van de slimste beschikbare AI-modellen (inclusief de allerlaatste versies van GPT en open-source modellen). De resultaten waren verrassend slecht.
- De Score: Zelfs de "slimste" AI (GPT-5.2) kreeg slechts 58,7% van de antwoorden goed. Dat is nauwelijks slagen voor een middelbareschoolgeschiedenisquiz.
- Het Kloof: De AI was goed in simpele dingen, zoals het weten dat plastic in oude tijden niet bestond (92% nauwkeurigheid). Maar het faalde volledig in complexe tijdreizen.
- Het Ordeningsprobleem: Toen ze werden gevraagd om vier objecten van oudst naar nieuwst te rangschikken, kreeg de beste AI het slechts 37% van de tijd goed. Het is alsof je een kind vraagt om een kaartspel te sorteren op datum, en ze blijven ze willekeurig door elkaar schudden.
- Het "Buitensporige" Probleem: Toen ze werden gevraagd om het ene object te spotten dat tot een ander tijdperk behoort dan de anderen, had de AI moeite om de subtiele verschillen in stijl en materiaal te zien.
Waarom gebeurt dit?
Het paper suggereert twee hoofdredenen, met behulp van een "Feit versus Relatie"-analogie:
- Memoriseren versus Redeneren: De AI is goed in het memoriseren van feiten (bijvoorbeeld "Plastic = Modern"). Het is als een student die het woordenboek heeft uit zijn hoofd geleerd, maar niet begrijpt hoe je een verhaal schrijft.
- Het Relatiegat: De AI is slecht in het verbinden van de puntjes door de tijd heen. Het kan niet naar vier verschillende objecten kijken en begrijpen hoe ze chronologisch met elkaar samenhangen. Het is als een detective die individuele aanwijzingen kan identificeren, maar de tijdlijn van het misdrijf niet kan achterhalen.
De onderzoekers ontdekten dat dit niet alleen een probleem is omdat de AI "te klein" is of "niet slim genoeg". Zelfs de grootste, duurste modellen faalden. Het lijkt erop dat de AI fundamenteel is getraind op "vandaag's" afbeeldingen en woorden, dus het heeft moeite om het "gisteren" van de geschiedenis te verbeelden.
De "Westelijke Bias" Verrassing
Het paper voerde ook een klein zij-experiment uit. Ze testten de AI op Westerse artefacten (zoals Griekse standbeelden) versus Indiase artefacten.
- Het Resultaat: De AI presteerde aanzienlijk beter op Westerse objecten.
- De Analogie: Het is als een student die hard heeft gestudeerd voor een test over Amerikaanse geschiedenis, maar nauwelijks het boek over Indiase geschiedenis heeft opengemaakt. Omdat de AI voornamelijk is getraind op Westerse data, begrijpt het Westerse geschiedenis beter, maar raakt het in de war wanneer het naar niet-Westerse culturen kijkt.
De Conclusie
Dit paper zegt niet dat AI geen foto's kan bekijken. Het zegt dat AI momenteel een slechte historicus is.
Als je deze modellen gebruikt in een museum of school om oude artefacten uit te leggen, kunnen ze per ongeluk studenten leren dat oude mensen moderne materialen gebruikten of dat de tijdlijn van de geschiedenis door elkaar zit. De auteurs concluderen dat we, voordat we AI met ons culturele erfgoed toevertrouwen, het moeten leren respecteren voor de stroom van de tijd, niet alleen de stroom van pixels.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.