← Últimos artículos
📊 statistics

Inducing Spatial Locality in Vision Transformers through the Training Protocol

Este artículo demuestra que la técnica de aumento de datos CutMix dentro de los protocolos de entrenamiento modernos induce localidad espacial y atención concentrada en las primeras capas de los Transformadores de Visión entrenados desde cero, sin requerir preentrenamiento a gran escala.

Autores originales: Eduardo Santiago Toledo, Asael Fabian Martínez

Publicado 2026-05-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Eduardo Santiago Toledo, Asael Fabian Martínez

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante a reconocer diferentes animales en una foto. Tienes dos formas de enseñarles:

  1. El Método "Antiguo": Les muestras la imagen completa y dices: "Esto es un gato". Ellos miran la imagen completa, quizás se confunden con el fondo, e intentan adivinar la respuesta basándose en la sensación general.
  2. El Método "Moderno": Les muestras la imagen completa, pero luego juegas un juego donde cubres partes aleatorias de la foto con una nota adhesiva de una imagen diferente. Ahora, para adivinar "gato", deben enfocarse intensamente en las pequeñas partes visibles del gato que quedan, ignorando el resto.

Este artículo trata sobre lo que sucede dentro de un tipo específico de cerebro de IA llamado Transformador de Visión (ViT) cuando utilizas estos dos métodos de enseñanza diferentes.

El Problema: El "Mirador Global"

Los Transformadores de Visión son potentes, pero tienen un rasgo peculiar. A diferencia de los ojos humanos (o modelos de IA más antiguos llamados CNN) que naturalmente miran primero pequeños detalles cercanos, los ViT están diseñados para mirar todo a la vez. Cada parte de la imagen puede "hablar" con cualquier otra parte inmediatamente.

Los investigadores querían saber: ¿Podemos enseñar a un ViT a mirar pequeños detalles locales (como la oreja de un gato) sin necesidad de mostrarle millones de imágenes primero?

El Experimento: Dos Protocolos de Entrenamiento

Los investigadores tomaron un modelo de IA pequeño y fresco, y lo entrenaron en tres conjuntos diferentes de imágenes (como un pequeño zoológico, un zoológico mediano y un zoológico grande). Mantuvieron la estructura del cerebro de la IA exactamente igual, pero cambiaron cómo la enseñaron:

  • La Línea Base (Antiguo): Simplemente mostraron las imágenes con giros y recortes básicos.
  • El Moderno (El Juego de la "Nota Adhesiva"): Agregaron tres trucos sofisticados:
    1. AutoAugment: Cambiar automáticamente colores y formas para hacer que las imágenes se vean diferentes.
    2. Suavizado de Etiquetas (Label Smoothing): Decirle a la IA: "No estés 100% seguro; sé un poco humilde".
    3. CutMix: Este es el protagonista del espectáculo. Cortan un cuadrado de una imagen y lo pegan sobre otra. La IA tiene que adivinar el animal incluso aunque parte de él falte o haya sido reemplazado.

El Descubrimiento: El Efecto "CutMix"

Los investigadores midieron qué tan "local" era la atención de la IA. ¿Miraba toda la habitación, o solo la oreja del gato?

  • El Resultado: El método "Moderno" hizo que las primeras capas de la IA (las primeras cosas en las que "piensa") se enfocaran muy estrechamente en áreas pequeñas y cercanas. Se volvió mucho más parecida a un ojo humano o a una lente de cámara tradicional.
  • La Sorpresa: Cuando desglosaron el método "Moderno" para ver qué truco estaba haciendo el trabajo pesado, descubrieron que CutMix era el único que importaba.
    • Agregar solo los "cambios de color" (AutoAugment) o la "humildad" (Suavizado de Etiquetas) no hizo nada para hacer que la IA mirara localmente.
    • Agregar solo CutMix al entrenamiento básico hizo que la IA de repente comenzara a enfocarse en detalles locales.
    • Eliminar CutMix del entrenamiento sofisticado hizo que la IA olvidara cómo enfocarse localmente, incluso si los otros trucos seguían ahí.

La Analogía: La Presión de la "Vista Parcial"

¿Por qué funciona CutMix? El artículo sugiere que se trata de presión.

Imagina que estás intentando identificar a un amigo en una multitud, pero alguien sigue poniendo un cartel frente a su cara. Ya no puedes confiar en su rostro completo ni en su atuendo general. Estás obligado a mirar muy de cerca el único ojo o la oreja que es visible. Aprendes a reconocerlos por sus características locales y específicas en lugar de la imagen completa.

CutMix fuerza a la IA a esta misma situación. Debido que partes de la imagen se intercambian constantemente, la IA aprende que no puede confiar en el contexto global. Debe aprender a extraer información útil de pequeños vecindarios locales para obtener la respuesta correcta.

La Conclusión

  • Lo que encontraron: No necesitas millones de imágenes para hacer que un Transformador de Visión se enfoque en detalles locales. Solo necesitas usar un truco de entrenamiento específico llamado CutMix.
  • Lo que hace: Fuerza a las primeras capas de la IA a actuar como un detector local (enfocándose en pequeños parches) en lugar de un escáner global.
  • Lo que no hace: Los otros trucos de entrenamiento populares (cambiar colores o suavizar la confianza) mejoran la puntuación de la IA, pero no cambian cómo la IA mira la imagen. Solo CutMix cambia la "mirada".

En resumen, si quieres que tu IA aprenda a mirar los árboles antes que el bosque, no solo le muestres más imágenes; muéstrale imágenes con agujeros en ellas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →