← Últimos artículos
🤖 AI

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

Este artículo presenta SEMA, un mecanismo de atención escalable y eficiente que combina la localización de tokens para prevenir la dispersión de pesos con el promedio aritmético para capturar el contexto global, superando así a los modelos existentes de atención lineal y Mamba de visión en tareas de clasificación de imágenes.

Autores originales: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a reconocer un gato en una foto. Para hacer esto, el robot utiliza una herramienta especial llamada "atención", que actúa como un reflector. Este reflector escanea toda la imagen, decidiendo qué píxeles son importantes (como las orejas del gato) y cuáles son solo ruido de fondo (como un árbol borroso). El problema es que, a medida que la foto se hace más grande, el reflector tiene que revisar cada píxel contra cada otro píxel. Si la foto es pequeña, esto es rápido. Pero si la foto es enorme, el robot se siente abrumado, pasando tanto tiempo revisando conexiones que se queda sin batería antes de poder siquiera decir "gato".

Los científicos han intentado solucionar esto haciendo que el reflector sea "lineal", lo que significa que revisa los píxeles en una línea más simple y rápida. Pero hay un inconveniente: estos reflectores rápidos suelen perder su enfoque. A medida que la imagen se agranda, empiezan a tratar cada píxel como si fuera igual de importante, como una linterna que se ha bajado tanto su intensidad que simplemente brilla de manera uniforme por toda la habitación. El robot deja de ver al gato y empieza a ver una mancha gris. Este artículo, escrito por investigadores de la Universidad de California, Irvine, y Qualcomm AI Research, aborda exactamente este problema. Quieren construir un reflector que sea lo suficientemente rápido para manejar imágenes gigantes y lo suficientemente nítido como para seguir viendo los detalles.

Los investigadores, liderados por Nhat Thanh Tran y sus colegas, descubrieron una verdad matemática que explica por qué estos reflectores rápidos fallan: a medida que el número de píxeles (o "tokens") tiende al infinito, el mecanismo de atención se dispersa naturalmente y se vuelve inútil. Llaman a esto el fenómeno de la "dispersión". Es como intentar escuchar un susurro en un estadio; si intentas escuchar a todo el mundo a la vez, terminas escuchando nada más que ruido. El artículo demuestra que, sin importar cómo ajustes las matemáticas de estas herramientas de atención rápida, eventualmente perderán su enfoque si la imagen se vuelve demasiado grande.

Para resolver esto, el equipo inventó un nuevo método llamado SEMA (Atención tipo Mamba escalable y eficiente). En lugar de luchar contra las matemáticas, decidieron trabajar con ellas. Se dieron cuenta de que, si bien el reflector debería enfocarse en detalles específicos, también necesita una forma de entender el "panorama general" sin perderse. Por ello, diseñaron un sistema de dos partes. Primero, utilizan la Localización de Tokens (Token Localization), que es como darle al reflector una pequeña ventana para mirar a través. Solo se enfoca en un pequeño vecindario de píxeles a la vez, asegurando que nunca se sienta abrumado o distraído. Esto mantiene el enfoque nítido.

Pero mirar a través de una ventana pequeña tiene un inconveniente: el robot podría perderse al gato completo si solo está mirando una pata. Para solucionar esto, SEMA añade un segundo paso: el Promedio (Averaging). Esto es como tomar una instantánea rápida y borrosa de toda la habitación y añadirla a la vista detallada. Los investigadores demostraron matemáticamente que, cuando la imagen es enorme, la mejor manera de capturar la sensación "global" de la imagen es simplemente promediar todo. Al combinar la vista nítida de la ventana local con este promedio global simple, SEMA obtiene lo mejor de ambos mundos.

El artículo muestra que este enfoque funciona increíblemente bien. Cuando probaron SEMA en conjuntos de datos de imágenes estándar como ImageNet-1K, superó a otros modelos populares, incluidos los modelos recientes "Mamba", especialmente cuando las imágenes eran muy grandes. Por ejemplo, cuando el tamaño de la imagen se aumentó a 1024x1024 píxeles, otros modelos tuvieron dificultades significativas, cayendo en precisión, mientras que SEMA se mantuvo fuerte e incluso mejoró. Los investigadores también descubrieron que SEMA era más rápido que sus competidores, tomando menos tiempo para procesar imágenes grandes.

Una de las partes más interesantes del artículo es cómo manejaron el problema de la "dispersión". En lugar de intentar forzar la atención para que se mantuviera nítida de una manera que rompiera las matemáticas, aceptaron que, para imágenes enormes, la atención debería dispersarse. Utilizaron esta naturaleza de dispersión a su favor usando un promedio simple para representar la información global. Es un poco como darse cuenta de que, si tienes un millón de amigos, no puedes recordar cada detalle de cada uno, pero puedes recordar la vibra general del grupo. SEMA recuerda los detalles del vecindario inmediato y la vibra general del grupo, permitiéndole reconocer al gato perfectamente, sin importar cuán grande sea la foto.

Los autores probaron su idea en diversas tareas, desde el reconocimiento de objetos hasta la localización de partes específicas de una imagen (segmentación). En cada caso, SEMA demostró que podía escalar a imágenes más grandes sin perder la cabeza. Incluso mostraron que, a medida que las imágenes se hacían más grandes, la parte del "promedio" de su sistema se volvía más importante, demostrando su teoría de que este paso simple es crucial para manejar cantidades masivas de datos. Aunque el artículo se centra en la visión por computadora, el equipo sugiere que esta idea podría ayudar con otros problemas que involucran secuencias largas de datos, como el análisis de enormes escaneos médicos.

En resumen, SEMA es un truco inteligente que admite cuándo un reflector se vuelve demasiado ancho para ser útil y cambia a una estrategia diferente: mirar de cerca los detalles cercanos y tomar un promedio rápido y simple del resto. Es una forma escalable, eficiente y matemáticamente sólida de ayudar a las computadoras a ver el mundo con claridad, incluso cuando el mundo se vuelve muy grande.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →