Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
Cet article présente la première application des Vision Transformers (ViT) à l'identification automatisée des éléments sémantiques sur les monnaies de la Rome antique à l'aide de données multimodales, démontrant que les modèles ViT surpassent les CNN traditionnels en termes de précision.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez une immense bibliothèque poussiéreuse de pièces romaines antiques. Certaines sont brillantes, d'autres sont usées, et beaucoup sont couvertes de saleté. Pendant des siècles, seuls quelques experts dotés de décennies de formation pouvaient regarder une pièce, scruter les minuscules dessins dessus, et dire : « Ah, celle-ci a un cheval » ou « Celle-ci présente un bouclier ».
Ce document traite de l'enseignement aux ordinateurs pour qu'ils puissent accomplir ce même travail, mais avec une nuance : les chercheurs ont voulu voir si un nouveau type de cerveau informatique appelé Vision Transformer (ViT) est meilleur qu'un Réseau de Neurones Convolutifs (CNN), qui est la norme habituelle.
Voici l'histoire de leur expérience, décomposée en termes simples.
Le Problème : Une bibliothèque de 100 000 pièces
Les chercheurs ont commencé avec une énorme collection de 100 000 images de pièces et leurs descriptions, provenant d'un site de vente aux enchères en ligne. Considérez cela comme un immense tas de pièces de puzzle.
- Le Défi : Les pièces anciennes sont délicates. Elles sont souvent rayées, les images sont stylisées (pas réalistes) et le même type de pièce peut paraître légèrement différent selon le moule (la matrice) utilisé pour la fabriquer.
- L'Objectif : Au lieu de simplement faire correspondre une pièce à une autre (comme un jeu de « trouve le jumeau »), ils voulaient que l'ordinateur comprenne la signification des images. L'ordinateur peut-il repérer une « corne d'abondance » ? Peut-il dire si une figure est « debout » ou « assise » ?
Les Contendants : La Vieille Garde contre le Nouveau Venu
Pour résoudre cela, ils ont opposé deux architectures informatiques différentes :
Le CNN (Le Détective Local) :
Imaginez un détective qui examine une image en examinant de petites zones une par une. Il regarde le coin supérieur gauche, puis le coin supérieur droit, puis le milieu. Il est très doué pour repérer des motifs locaux, comme une courbe ou une ligne spécifique. Cependant, il peut parfois avoir une vision tunnel, se concentrant trop sur un petit endroit et manquant la vue d'ensemble.Le ViT (L'Observateur Global) :
Le Vision Transformer est le nouveau venu sur le marché. Au lieu de regarder les images une par une, imaginez un détective qui regarde l'image entière d'un seul coup, comprenant instantanément comment le coin supérieur gauche est lié au coin inférieur droit. Il traite l'image comme une phrase, où chaque partie est connectée à toutes les autres. Cela lui permet de voir des connexions à « longue portée » que le détective local pourrait manquer.
L'Expérience : Entraîner les Cerveaux
Les chercheurs ont d'abord dû nettoyer leurs données. Les photos originales montraient souvent les deux faces de la pièce (recto et verso) ou plusieurs pièces entassées. Ils ont écrit un programme pour découper uniquement le revers (le « verso ») de la pièce, qui possède généralement les images les plus intéressantes.
Ils ont ensuite injecté ces images nettoyées dans les deux types d'ordinateurs.
- Le CNN a été entraîné sur un concept spécifique à la fois (ex : « Trouvez tous les aigles »).
- Le ViT était un multitâche ; il a appris à trouver tous les concepts (aigles, boucliers, chevaux, etc.) en même temps dans un seul modèle.
Les Résultats : Qui a Gagné ?
Une fois l'entraînement terminé, ils ont testé les ordinateurs sur des pièces qu'ils n'avaient jamais vues auparavant.
- Le Gagnant : Le Vision Transformer (ViT) a généralement gagné. Il était plus précis pour identifier les éléments sémantiques (les images) que le CNN.
- La Vitesse : Le CNN était beaucoup plus rapide à entraîner (comme un sprinter), tandis que le ViT prenait beaucoup plus de temps (comme un marathonien), mais il a obtenu un meilleur temps de finition en termes de précision.
- Le « Pourquoi » : Les chercheurs ont constaté que le ViT était meilleur pour gérer la nature désordonnée et usée des pièces. Il ne se laissait pas aussi facilement troubler lorsque l'image était légèrement différente de ce qu'il attendait.
La « Vision par Rayons X » (Cartes de Saillance)
Pour comprendre comment les ordinateurs réfléchissaient, les chercheurs ont utilisé un outil appelé « cartographie de saillance ». C'est comme projeter un rayon X sur l'image pour voir quelles parties l'ordinateur regardait pour prendre sa décision.
- L'Éclat X du CNN : Le CNN avait tendance à se concentrer sur un point précis et minuscule. Par exemple, lorsqu'il cherchait un aigle, il regardait presque toujours le coin inférieur droit de la pièce, là où les ailes de l'aigle apparaissent souvent. C'était comme un étudiant qui avait mémorisé que « les aigles sont toujours en bas à droite » plutôt que de réellement reconnaître l'oiseau.
- L'Éclat X du ViT : Le focus du ViT était beaucoup plus dispersé et varié. Parfois, il regardait les plumes de l'aigle, parfois l'arrière-plan, parfois le texte à proximité. Il était plus difficile de prédire exactement où il regardait, mais cela suggélaient qu'il était réellement en train de « comprendre » toute la scène plutôt que de simplement mémoriser un emplacement.
Le Piège : Étiquettes Bruyantes
Le document admet une faille majeure de l'expérience : les « réponses » données aux ordinateurs étaient désordonnées.
Les ordinateurs ont été entraînés à l'aide de descriptions textuelles provenant du site de vente aux enchères. Or, ces descriptions parlaient souvent des deux côtés de la pièce.
- Exemple : Une description pourrait dire : « Recto : Tête de l'empereur. Verso : Un cheval debout. »
- L'Erreur : L'ordinateur n'était montré que le verso (le cheval), mais l'étiquette disait « Debout ». Cependant, parfois la description disait « Debout » à cause du recto de la pièce, même si le verso ne présentait pas de figure debout.
- Le Résultat : Les ordinateurs apprenaient parfois à partir des mauvais indices. Les chercheurs ont noté que ce « bruit » a probablement freiné les performances des deux modèles, particulièrement pour des concepts comme « debout » ou « assis ».
La Conclusion
Le document conclut que les Vision Transformers sont un nouvel outil prometteur pour l'étude des pièces anciennes. Ils ont surpassé les anciens modèles CNN en termes de précision, suggérant que l'approche de l'« Observateur Global » est mieux adaptée au monde complexe et désordonné de l'histoire ancienne.
Cependant, les chercheurs préviennent que pour obtenir de meilleurs résultats, nous avons besoin de données plus propres. Si nous pouvons apprendre à l'ordinateur à ignorer le texte du « recto de la pièce » lorsqu'il regarde l'image du « verso de la pièce », ces historiens numériques pourraient devenir encore plus puissants.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.