Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
Este artículo presenta la primera aplicación de los Vision Transformers (ViT) para la identificación automatizada de elementos semánticos en monedas romanas antiguas utilizando datos multimodales, demostrando que los modelos ViT superan a las CNN tradicionales en precisión.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes una biblioteca masiva y polvorienta de monedas romanas antiguas. Algunas son brillantes, otras están desgastadas y muchas están cubiertas de suciedad. Durante siglos, solo unos pocos expertos con décadas de formación podían mirar una moneda, entrecerrar los ojos ante las diminutas imágenes en ella y decir: "Ah, esta tiene un caballo", o "Esta presenta un escudo".
Este artículo trata de enseñar a las computadoras a hacer ese mismo trabajo, pero con un giro: los investigadores querían ver si un nuevo tipo de cerebro computacional llamado Vision Transformer (ViT) es mejor en esto que el estándar antiguo, la Red Neuronal Convolucional (CNN).
Aquí está la historia de su experimento, desglosada en términos sencillos.
El Problema: Una Biblioteca de 100,000 Monedas
Los investigadores comenzaron con una enorme colección de 100,000 imágenes de monedas y sus descripciones, tomadas de un sitio de subastas en línea. Piensa en esto como una gigante pila de piezas de rompecabezas.
- El Desafío: Las monedas antiguas son complicadas. A menudo están rayadas, las imágenes están estilizadas (no son realistas) y el mismo tipo de moneda puede verse ligeramente diferente dependiendo de qué molde (matriz) se haya usado para fabricarla.
- El Objetivo: En lugar de solo emparejar una moneda con otra (como un juego de "encontrar al gemelo"), querían que la computadora entendiera el significado de las imágenes. ¿Puede la computadora detectar una "cornucopia" (un cuerno de la abundancia)? ¿Puede distinguir si una figura está "de pie" o "sentada"?
Los Contendientes: La Vieja Guardia vs. El Nuevo Integrante
Para resolver esto, enfrentaron dos arquitecturas de computadora diferentes:
La CNN (El "Detective Local"):
Imagina a un detective que mira una imagen examinando pequeños parches uno por uno. Mira la esquina superior izquierda, luego la esquina superior derecha, luego el medio. Son muy buenos detectando patrones locales, como una curva o línea específica. Sin embargo, a veces pueden tener visión de túnel, enfocándose demasiado en un pequeño punto y perdiendo de vista el panorama general.El ViT (El "Observador Global"):
El Vision Transformer es el nuevo integrante en la escena. En lugar de mirar parches uno por uno, imagina a un detective que mira la imagen completa de una vez, comprendiendo instantáneamente cómo la esquina superior izquierda se relaciona con la esquina inferior derecha. Trata la imagen como una oración, donde cada parte está conectada con todas las demás partes. Esto le permite ver conexiones de "largo alcance" que el detective local podría pasar por alto.
El Experimento: Entrenando los Cerebros
Los investigadores tuvieron que limpiar sus datos primero. Las fotos originales a menudo mostraban ambos lados de la moneda (anverso y reverso) o múltiples monedas en una pila. Escribieron un programa para recortar solo el lado posterior (el "reverso") de la moneda, que usualmente tiene las imágenes más interesantes.
Luego, alimentaron estas imágenes limpias en ambos tipos de computadoras.
- La CNN fue entrenada en un concepto específico a la vez (por ejemplo, "Busca todos los águilas").
- El ViT era un multitareas; aprendió a encontrar todos los conceptos (águilas, escudos, caballos, etc.) al mismo tiempo en un solo modelo.
Los Resultados: ¿Quién Ganó?
Después de que terminó el entrenamiento, probaron las computadoras con monedas que nunca habían visto antes.
- El Ganador: El Vision Transformer (ViT) generalmente ganó. Fue más preciso identificando los elementos semánticos (las imágenes) que la CNN.
- La Velocidad: La CNN fue mucho más rápida de entrenar (como un velocista), mientras que el ViT tomó mucho más tiempo (como un corredor de maratón), pero terminó con un mejor tiempo de llegada en términos de precisión.
- El "Porqué": Los investigadores encontraron que el ViT era mejor manejando la naturaleza desordenada y desgastada de las monedas. No se confundía tan fácilmente cuando la imagen era ligeramente diferente de lo que esperaba.
La "Visión de Rayos X" (Mapas de Saliencia)
Para entender cómo estaban pensando las computadoras, los investigadores usaron una herramienta llamada "mapeo de saliencia". Esto es como pasar una radiografía por la imagen para ver en qué partes estaba mirando la computadora para tomar su decisión.
- La Radiografía de la CNN: La CNN tendía a enfocarse en un punto específico y diminuto. Por ejemplo, al buscar un águila, casi siempre miraba fijamente la esquina inferior derecha de la moneda, donde las alas del águila suelen aparecer. Era como un estudiante que memorizó que "las águilas siempre están en la parte inferior derecha" en lugar de realmente reconocer al ave.
- La Radiografía del ViT: El enfoque del ViT era mucho más disperso y variado. A veces miraba las plumas del águila, a veces el fondo, a veces el texto cercano. Era más difícil predecir exactamente hacia dónde estaba mirando, pero esto sugería que realmente estaba "entendiendo" toda la escena en lugar de solo memorizar una ubicación.
El Problema: Etiquetas Ruidosas
El artículo admite un fallo importante en el experimento: las "respuestas" que les dieron a las computadoras eran desordenadas. Las computadoras fueron entrenadas usando descripciones de texto del sitio de subastas. Pero estas descripciones a menudo hablaban de ambos lados de la moneda.
- Ejemplo: Una descripción podría decir: "Anverso: Cabeza de Emperador. Reverso: Un caballo de pie".
- El Error: La computadora fue mostrada solo el reverso (el caballo), pero la etiqueta decía "De pie". Sin embargo, a veces la descripción decía "De pie" debido al anverso de la moneda, aunque el reverso no tuviera una figura de pie.
- El Resultado: Las computadoras a veces estaban aprendiendo de las pistas equivocadas. Los investigadores señalaron que este "ruido" probablemente limitó el rendimiento de ambos modelos, especialmente para conceptos como "de pie" o "sentado".
La Conclusión
El artículo concluye que los Vision Transformers son una nueva herramienta prometedora para el estudio de las monedas antiguas. Superaron a los modelos CNN más antiguos en precisión, lo que sugiere que el enfoque del "Observador Global" es más adecuado para el mundo complejo y desordenado de la historia antigua.
Sin embargo, los investigadores advierten que para obtener mejores resultados, necesitamos datos más limpios. Si podemos enseñar a la computadora a ignorar el texto del "anverso de la moneda" cuando mira la imagen del "reverso de la moneda", estos historiadores digitales podrían volverse aún más poderosos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.