← Últimos artículos
🤖 machine learning

MergeOver: Post-Training Token Merging for Recursive Vision Transformers

MergeOver es un método de post-entrenamiento que integra el Token Merging en Vision Transformers con pesos compartidos recursivamente para reducir significativamente el uso de memoria y la latencia en dispositivos periféricos manteniendo una alta precisión, todo ello sin requerir un reentrenamiento costoso.

Autores originales: Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente a reconocer gatos, perros y coches solo con mirar fotos. Para hacer esto, el robot utiliza un tipo especial de cerebro llamado "Vision Transformer". Piensa en este cerebro como un equipo de diminutos detectives, donde cada uno de los píxeles de una foto tiene su propio detective. Cuantos más píxeles haya, más detectives se necesitan, y más tienen que hablar entre ellos para averiguar qué están viendo. Esto es fantástico para la precisión, pero es un gran problema para las computadoras pequeñas, como las de tu reloj inteligente o una Raspberry Pi, porque no tienen suficiente memoria o potencia de batería para manejar a miles de detectives charlando a la vez.

Para solucionar esto, los científicos han probado dos trucos principales. El primero es el "intercambio de pesos recursivo" (recursive weight-sharing), que es como tener un superdetective que hace el mismo trabajo una y otra vez, reutilizando sus notas en lugar de contratar un nuevo equipo para cada paso. Esto ahorra espacio, pero hace que el trabajo del detective sea más lento y pesado. El segundo truco es la "fusión de tokens" (token merging), donde te das cuenta de que algunos detectives están mirando lo mismo, así que simplemente fusionas a varios en un solo detective grande para ahorrar tiempo. La gran pregunta que este artículo aborda es: ¿Qué pasa si intentas usar ambos trucos al mismo tiempo sin tener que reentrenar a todo el robot desde cero? Es como intentar enseñar a un solo detective a fusionarse con sus clones mientras ya está trabajando, sin estropear el mapa que está siguiendo.

Los autores de este artículo, Junseo Kim y su equipo de la Universidad de Twente, dicen que intentar mezclar estos dos métodos suele ser un desastre porque las reglas del juego se rompen. Ellos proponen un nuevo método llamado MergeOver para resolver este rompecabezas. Imagina que el cerebro del robot es un edificio de varios pisos donde los detectives suben de planta. Cada vez que pasan a un nuevo piso, la arquitectura del edificio requiere que se coloquen en una cuadrícula de un cuadrado perfecto. Pero fusionar detectives suele arruinar esa cuadrícula cuadrada, dejando espacios vacíos que rompen el ascensor. MergeOver introduce un ingenioso truque de "desfusión" (Unmerge): separa temporalmente a los detectives fusionados de vuelta a sus posiciones originales en la cuadrícula solo el tiempo suficiente para pasar por el ascensor, y luego los vuelve a fusionar una vez que están seguros en el siguiente piso. Esto permite que el robot mantenga su uso de memoria bajo sin necesidad de ser reentrenado.

El equipo probó esto en un famoso conjunto de datos de imágenes llamado ImageNet-1K, utilizando diferentes tipos de computadoras, desde potentes tarjetas gráficas hasta una diminuta Raspberry Pi 5. Encontraron que MergeOver funciona, pero los resultados dependen mucho de cuántas fotos le pides al robot que vea a la vez (el "tamaño del lote" o batch size). Cuando el robot mira una sola foto a la vez, el trabajo extra de fusionar y desfusionar en realidad hace que sea un poco más lento. Sin embargo, cuando el robot mira 16 fotos a la vez, ocurre la magia. En una GPU potente, esta configuración redujo la memoria necesaria en un 38.4% y de hecho hizo que el robot fuera un 21.7% más rápido. En la diminuta Raspberry Pi, hizo que el robot fuera un 17.6% más rápido para lotes de 16. Lo mejor de todo es que el robot no se volvió mucho más tonto; su precisión solo cayó un 1.47 puntos porcentuales, lo cual los autores dicen que es un precio pequeño a pagar por un aumento de velocidad tan grande.

Sin embargo, el artículo es cuidadoso al señalar que esto no es una varita mágica que lo arregla todo instantáneamente. Los autores argumentan explícitamente contra la idea de que puedes simplemente aplicar esto a cualquier modelo y esperar que funcione perfectamente en todas partes. Descubrieron que para tareas de una sola imagen (tamaño de lote 1), el método en realidad ralentiza las cosas en computadoras potentes porque la carga de trabajo del truque de "desfusión" no vale la pena para una sola imagen. También señalan que, si bien su método ahorra mucha memoria y acelera el procesamiento por lotes, no necesariamente supera a todos los otros tipos de modelos de IA eficientes que fueron diseñados desde cero para ser rápidos. Los resultados son medidos y reales, pero sugieren que esto es un punto de partida prometedor —un "punto de referencia"— para combinar estas técnicas, más que una solución final y perfecta. Los autores sugieren que el trabajo futuro podría necesitar combinar MergeOver con otros trucos, como una mejor optimización de software, para hacerlo aún más rápido, especialmente para esas tareas de una sola imagen en dispositivos pequeños.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →