Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
Questo articolo presenta la prima applicazione dei Vision Transformer (ViT) all'identificazione automatizzata degli elementi semantici sulle monete romane antiche utilizzando dati multimodali, dimostrando che i modelli ViT superano le tradizionali CNN in termini di accuratezza.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate di avere una massiccia e polverosa biblioteca di monete romane antiche. Alcune sono lucide, altre sono consumate e molte sono coperte di sporco. Per secoli, solo pochi esperti con decenni di esperienza potevano guardare una moneta, socchiudere gli occhi per scrutare le minuscole immagini sopra di essa e dire: "Ah, questa ha un cavallo" o "Questa presenta uno scudo".
Questo articolo parla di come insegnare ai computer a fare lo stesso lavoro, ma con un tocco particolare: i ricercatori volevano vedere se un nuovo tipo di cervello informatico chiamato Vision Transformer (ViT) è migliore di quello standard, la Rete Neurale Convoluzionale (CNN).
Ecco la storia del loro esperimento, suddivisa in termini semplici.
Il Problema: Una Biblioteca di 100.000 Monete
I ricercatori sono partiti da una enorme collezione di 100.000 immagini di monete e le loro descrizioni, prese da un sito di aste online. Pensate a questo come a un gigantesco mucchio di pezzi di un puzzle.
- La Sfida: Le monete antiche sono complicate. Sono spesso graffiate, le immagini sono stilizzate (non realistiche) e lo stesso tipo di moneta può apparire leggermente diverso a seconda del calco (conio) utilizzato per produrla.
- L'Obiettivo: Invece di limitarsi a far corrispondere una moneta con un'altra (come nel gioco del "trova la tua metà"), volevano che il computer comprendesse il significato delle immagini. Il computer riesce a individuare una "cornucopia" (un corno dell'abbondanza)? Può capire se una figura è in posizione "eretta" o "seduta"?
I Concorrenti: La Vecchia Guardia contro il Nuovo Arrivato
Per risolvere questo problema, hanno messo l'uno contro l'altro due diverse architetture informatiche:
La CNN (Il "Detective Locale"):
Immaginate un detective che esamina un'immagine esaminando piccoli frammenti uno alla volta. Guarda l'angolo in alto a sinistra, poi l'angolo in alto a destra, poi il centro. È molto bravo a individuare schemi locali, come una specifica curva o una linea. Tuttavia, può a volte soffrire di visione a tunnel, concentrandosi troppo su un piccolo punto e perdendo di vista l'immagine complessiva.Il ViT (L' "Osservatore Globale"):
Il Vision Transformer è il nuovo arrivato sul campo. Invece di guardare i frammenti uno alla volta, immaginate un detective che guarda l'intera immagine istantaneamente, comprendendo come l'angolo in alto a sinistra sia correlato all'angolo in basso a destra. Tratta l'immagine come una frase, dove ogni parte è connessa a tutte le altre. Questo gli permette di vedere connessioni a "lungo raggio" che il detective locale potrebbe perdere.
L'Esperimento: Addestrare i Cervelli
I ricercatori hanno dovuto prima pulire i loro dati. Le foto originali mostravano spesso entrambi i lati della moneta (fronte e retro) o più monete in un mucchio. Hanno scritto un programma per ritagliare solo il lato posteriore (il "rovescio") della monzione, che di solito presenta le immagini più interessanti.
Hanno poi fornito queste immagini pulite ai due tipi di computer.
- La CNN è stata addestrata su un concetto specifico alla volta (ad esempio, "Trova tutte le aquile").
- Il ViT è stato un multitasking; ha imparato a trovare tutti i concetti (aquile, scudi, cavalli, ecc.) contemporaneamente in un unico modello.
I Risultati: Chi ha Vincuto?
Una volta terminato l'addestramento, hanno testato i computer su monete che non avevano mai visto prima.
- Il Vincitore: Il Vision Transformer (ViT) ha generalmente vinto. È stato più accurato nell'identificare gli elementi semantici (le immagini) rispetto alla CNN.
- La Velocità: La CNN è stata molto più veloce da addestrare (come uno sprinter), mentre il ViT ha richiesto molto più tempo (come un maratoneta), ma ha ottenuto un tempo di arrivo migliore in termini di accuratezza.
- Il "Perché": I ricercatori hanno scoperto che il ViT era migliore nel gestire la natura disordinata e logora delle monete. Non si confondeva facilmente quando l'immagine era leggermente diversa da quella prevista.
La "Visione a Raggi X" (Mappe di Saliency)
Per capire come i computer stavano pensando, i ricercatori hanno usato uno strumento chiamato "mappatura della salienza" (saliency mapping). Questo è come far passare un raggio X sull'immagine per vedere quali parti il computer stava guardando per prendere la sua decisione.
- L'Raggio X della CNN: La CNN tendeva a concentrarsi su un punto specifico e minuscolo. Ad esempio, quando cercava un'aquila, guardava quasi sempre l'angolo in basso a destra della moneta, dove spesso compaiono le ali dell'aquila. Era come uno studente che aveva memorizzato che "le aquile sono sempre in basso a destra" invece di riconoscere effettivamente l'uccello.
- L'Raggio X del ViT: Il focus del ViT era molto più sparso e variegato. A volte guardava le piume dell'aquila, a volte lo sfondo, a volte il testo vicino. Era più difficile prevedere esattamente dove stesse guardando, ma questo suggeriva che il ViT stesse effettivamente "comprendendo" l'intera scena invece di limitarsi a memorizzare una posizione.
Il Problema: Etichette Rumorose
Il documento ammette un difetto principale dell'esperimento: le "risposte" fornite ai computer erano disordinate.
I computer sono stati addestrati usando le descrizioni testuali del sito di aste. Ma queste descrizioni spesso parlavano di entrambi i lati della moneta.
- Esempio: Una descrizione potrebbe dire: "Fronte: Testa dell'imperatore. Retro: Un cavallo in piedi".
- L'Errore: Il computer veniva mostrato solo il retro (il cavallo), ma l'etichetta diceva "In piedi". Tuttavia, a volte la descrizione diceva "In piedi" perché riferita al fronte della moneta, anche se il retro non presentava una figura in piedi.
- Il Risultato: I computer stavano talvolta imparando dai segnali sbagliati. I ricercatori hanno notato che questo "rumore" probabilmente ha frenato le prestazioni di entrambi i modelli, specialmente per concetti come "in piedi" o "seduto".
La Conclusione
Il documento conclude che i Vision Transformer sono uno strumento promettente per lo studio delle monete antiche. Hanno superato i vecchi modelli CNN in termini di accuratezza, suggerendo che l'approccio dell' "Osservatore Globale" è più adatto al mondo complesso e disordinato della storia antica.
Tuttavia, i ricercatori avvertono che per ottenere risultati ancora migliori, abbiamo bisogno di dati più puliti. Se riusciamo a insegnare al computer a ignorare il testo relativo al "fronte della moneta" quando analizza l'immagine del "retro della moneta", questi storici digitali potrebbero diventare ancora più potenti.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.