Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
Dit artikel presenteert de eerste toepassing van Vision Transformers (ViT) voor de automatische identificatie van semantische elementen op antieke Romeinse munten met behulp van multi-modale data, waarbij wordt aangetoond dat ViT-modellen CNN's overtreffen in nauwkeurigheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, stoffige bibliotheek hebt vol met Romeinse munten. Sommige zijn glanzend, andere zijn versleten, en velen zijn bedekt met vuil. Eeuwenlang konden slechts enkele experts met decennia aan training naar een munt kijken, naar de kleine plaatjes op de munt te knijpen, en zeggen: "Ah, deze heeft een paard," of "Deze heeft een schild."
Dit artikel gaat over het leren van computers om hetzelfde werk te doen, maar met een twist: de onderzoekers wilden zien of een nieuw type computerbrein, een Vision Transformer (ViT), beter is dan de oude standaard, het Convolutional Neural Network (CNN).
Hier is het verhaal van hun experiment, uitgelegd in eenvoudige termen.
Het Probleem: Een Bibliotheek van 100.000 Munten
De onderzoekers begonnen met een enorme collectie van 100.000 muntafbeeldingen en hun beschrijvingen, afkomstig van een online veilingwebsite. Denk aan dit als een gigantische stapel puzzelstukjes.
- De Uitdaging: Oude munten zijn lastig. Ze zijn vaak gekrast, de afbeeldingen zijn gestileerd (niet realistisch) en hetzelfde type munt kan er iets anders uitzien afhankelijk van welke mal (stempel) werd gebruikt om hem te maken.
- Het Doel: In plaats van alleen één munt met een andere te matchen (zoals een "zoek de tweeling"-spel), wilden ze dat de computer de betekenis van de afbeeldingen begreep. Kan de computer een "cornucopia" (hoorn des overvloeds) herkennen? Kan hij zien of een figuur "staand" of "zittend" is?
De Tegenstanders: De Oude Garde versus De Nieuwe Jongen
Om dit op te lossen, lieten ze twee verschillende computerarchitecturen tegen elkaar strijden:
De CNN (De "Lokale Detective"):
Stel je een detective voor die naar een foto kijkt door kleine stukjes één voor één te onderzoeken. Hij kijkt naar de linkerbovenhoek, dan naar de rechterbovenhoek, dan naar het midden. Hij is erg goed in het herkennen van lokale patronen, zoals een specifieke curve of lijn. Echter, hij kan soms last krijgen van tunnelvisie, waarbij hij zich te veel op één klein plekje concentreert en het grote plaatje mist.De ViT (De "Globale Observator"):
De Vision Transformer is de nieuwe jongen in de klas. In plaats van naar stukjes één voor één te kijken, stel je een detective voor die de gehele foto in één oogopslag bekijkt en direct begrijpt hoe de linkerbovenhoek zich verhoudt tot de rechteronderhoek. Het behandelt de afbeelding als een zin, waarbij elk deel verbonden is met elk ander deel. Dit stelt het in staat om "lange-afstand"-verbindingen te zien die de lokale detective misschien zou missen.
Het Experiment: De Breinen Trainen
De onderzoekers moesten eerst hun data opschonen. De originele foto's toonden vaak beide kanten van de munt (voorzijde en achterzijde) of meerdere munten in een stapel. Ze schreven een programma om alleen de achterkant (de "reverse") van de munt uit te snijden, die meestal de meest interessante afbeeldingen bevat.
Vervolgens voedden ze deze opgeschoonde afbeeldingen aan beide typen computers.
- De CNN werd getraind op één specifiek concept tegelijk (bijv. "Zoek alle adelaars").
- De ViT was een multitasker; het leerde om alle concepten (adelaars, schilden, paarden, etc.) tegelijkertijd te vinden in één enkel model.
De Resultaten: Wie Won Er?
Nadat de training voltooid was, testten ze de computers op munten die ze nog nooit eerder hadden gezien.
- De Winnaar: De Vision Transformer (ViT) won over het algemeen. Het was nauwkeuriger in het identificeren van de semantische elementen (de afbeeldingen) dan de CNN.
- De Snelheid: De CNN was veel sneller om te trainen (als een sprinter), terwijl de ViT veel langer nodig had (als een marathonloper), maar eindigde met een betere eindtijd wat betreft nauwkeurigheid.
- Het "Waarom": De onderzoekers ontdekten dat de ViT beter was in het omgaan met de rommelige, versleten aard van de munten. Het raakte niet zo snel in de war wanneer een afbeelding iets anders was dan wat het verwachtte.
De "Röntgenvisie" (Saliency Maps)
Om te begrijpen hoe de computers dachten, gebruikten de onderzoekers een hulpmiddel genaamd "saliency mapping". Dit is als het schijnen van een röntgenfoto op de afbeelding om te zien naar welke delen de computer keek om zijn beslissing te nemen.
- De CNN's Röntgenfoto: De CNN had de neiging om zich op één specifiek, minuscuul punt te concentreren. Bijvoorbeeld, bij het zoeken naar een adelaar, staarde de CNN bijna altijd naar de rechteronderhoek van de munt, waar adelaarsvleugels vaak verschijnen. Het was alsof het een student was die uit het hoofd had geleerd dat "adelaars altijd rechtsonder staan", in plaats van daadwerkelijk de vogel te herkennen.
- De ViT's Röntgenfoto: De focus van de ViT was veel meer verspreid en gevarieerd. Soms keek het naar de veren van de adelaar, soms naar de achtergrond, soms naar de tekst in de buurt. Het was moeilijker te voorspellen waar het precies naar keek, maar dit suggereerde dat het daadwerkelijk de hele scène "begreep" in plaats van alleen een locatie te onthouden.
Het Nadeel: Ruis in de Labels
Het artikel geeft toe dat er een groot gebrek was in het experiment: de "antwoorden" die ze aan de computers gaven, waren slordig.
De computers werden getraind met tekstbeschrijvingen van de veilingsite. Maar deze beschrijvingen gingen vaak over beide kanten van de munt.
- Voorbeeld: Een beschrijving kon zeggen: "Voorzijde: Hoofd van de keizer. Achterzijde: Een staand paard."
- De Fout: De computer kreeg alleen de achterkant (het paard) te zien, maar het label zei "Staand". Echter, soms zei de beschrijving "Staand" vanwege de voorkant van de munt, ook al bevatte de achterkant geen staand figuur.
- Het Resultaat: De computers leerden soms van de verkeerde aanwijzingen. De onderzoekers merkten op dat deze "ruis" de prestaties van beide modellen waarschijnlijk heeft tegengehouden, vooral voor concepten zoals "staand" of "zittend".
De Conclusie
Het artikel concludeert dat Vision Transformers een veelbelovend nieuw instrument zijn voor het bestuderen van oude munten. Ze presteerden beter dan de oudere CNN-modellen qua nauwkeurigheid, wat suggereert dat de "Globale Observator"-aanpak beter geschikt is voor de complexe, rommelige wereld van de oude geschiedenis.
De onderzoekers waarschuwen echter dat we, om nog betere resultaten te behalen, een schonere dataset nodig hebben. Als we de computer kunnen leren om de tekst van de "voorkant van de munt" te negeren bij het bekijken van de "achterkant van de munt", kunnen deze digitale historici nog krachtiger worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.