← Últimos artículos
💻 computer science

Vision Transformers Need Better Token Interaction

Este trabajo identifica la "difusión semántica" como la causa de las representaciones de parche degradadas en los transformadores de visión durante el entrenamiento prolongado y propone reemplazar la atención softmax con entmax-1.5 para permitir interacciones selectivas entre tokens, lo que mejora significativamente el rendimiento en predicción densa mientras preserva el contexto global.

Autores originales: Linxiang Su

Publicado 2026-05-25
📖 4 min de lectura☕ Lectura para el café

Autores originales: Linxiang Su

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El Estudiante de "Sobre-Compartición"

Imagina un Transformador de Visión (ViT) como un aula llena de estudiantes (llamados tokens). Cada estudiante observa un pequeño fragmento de una foto (un parche).

  • El Objetivo: El profesor quiere que la clase haga dos cosas:
    1. Identificar la imagen completa (por ejemplo: "Esto es un perro").
    2. Dibujar un contorno perfecto alrededor de cada parte del perro (por ejemplo: "Este píxel es la oreja, este es la cola"). Esto se llama predicción densa.

El Problema:
A medida que la clase estudia más y más tiempo, se vuelven muy buenos identificando al perro. Sin embargo, su capacidad para dibujar el contorno se vuelve desordenada. Los estudiantes comienzan a "sobre-compartir".

El artículo llama a esto Difusión Semántica. Es como un estudiante en la última fila que sabe que la respuesta es "Perro" y empieza a gritar ese hecho a todos, incluso a los estudiantes que están mirando el césped o el cielo.

  • El Resultado: Los estudiantes que miran el césped empiezan a pensar: "¡Oh, debo ser parte del perro también!" porque han escuchado la información global.
  • La Consecuencia: El "contorno" se vuelve borroso. El modelo piensa que el fondo es parte del objeto, lo que lo hace malo en tareas como la segmentación (dibujar límites).

Las Soluciones Antiguas vs. La Nueva Idea

Investigadores anteriores intentaron solucionar esto mediante:

  • Añadir "Tomadores de Apuntes": Darle a la clase estudiantes especiales (Tokens de Registro) solo para guardar el ruido extra para que los demás no se confundan.
  • Reglas Estrictas: Decirles a los estudiantes: "Solo hablen con la persona sentada a su lado" (Ventanas Locales).

La Perspectiva del Autor:
El autor argumenta que no debemos prohibir la conversación global ni añadir estudiantes extra. El fondo tiene un contexto útil. El problema no es que hablen con todos; es que hablan con todos por igual, incluso cuando no tiene sentido.

La Solución: "Conversación Selectiva" (Atención Dispersa)
En lugar de obligar a los estudiantes a susurrar solo a sus vecinos, el autor sugiere cambiar el sistema de votación.

  • Sistema Viejo (Softmax): Imagina una votación donde cada estudiante recibe una pequeña cantidad, no nula, de atención. Incluso si un estudiante está mirando una nube, todavía recibe el 0,1% de la atención de la clase. Esto mantiene vivo el "ruido".
  • Sistema Nuevo (Entmax-1.5): Este es un sistema de votación más inteligente. Si un estudiante está mirando una nube, el sistema dice: "Recibes 0% de atención. Eres ignorado".
    • No impide que los estudiantes vean toda la habitación (la conectividad global se mantiene).
    • Solo asegura que si una conexión no es útil, se corte completamente (peso cero).

Piénsalo como un filtro. En lugar de dejar que un poco de información de "perro" se filtre al área de "césped", el filtro la bloquea por completo. El césped se queda siendo césped, y el perro se queda siendo perro.

¿Qué Pasó Cuando Lo Probaron?

Los investigadores probaron esto en un modelo estándar (DINOv1) entrenado en ImageNet. Simplemente cambiaron el "sistema de votación" (Softmax) por el "filtro selectivo" (Entmax-1.5) y no añadieron ninguna parte nueva ni datos de entrenamiento adicionales.

Los Resultados:

  1. Reconocimiento Global (El "Qué"): El modelo se volvió ligeramente mejor simplemente diciendo "Esto es un perro". (La precisión pasó del 69,50% al 70,06%).
  2. Predicción Densa (El "Dónde"): El modelo se volvió mucho mejor dibujando los contornos.
    • En el conjunto de datos VOC (una prueba estándar para límites de objetos), la puntuación aumentó significativamente (de 42,80 a 48,78).
    • También mejoró en otros mapas complejos como ADE20K y Cityscapes.
  3. Visuales: Cuando observaron el "mapa mental" de la computadora de la imagen, el nuevo modelo tenía límites mucho más limpios y nítidos. El fondo ya no se filtraba en el objeto.

La Conclusión

El artículo afirma que los Transformadores de Visión se vuelven desordenados al dibujar límites porque permiten que la información global se propague demasiado libremente, como un rumor que se distorsiona al pasar de persona a persona.

Al cambiar a un mecanismo de atención dispersa (Entmax-1.5), el modelo aprende a ser selectivo. Mantiene la imagen general en mente, pero detiene que el "ruido" se propague a áreas donde no pertenece. Esto hace que el modelo sea mejor tanto para identificar objetos como para ubicarlos con precisión, todo sin necesidad de una arquitectura más compleja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →