← Últimos artículos
🤖 machine learning

Improving MLLM Training Efficiency via Stage-Aware Sparsity

El artículo propone el Esquema de Entrenamiento Escaso (STS), un marco consciente de las etapas que mejora la eficiencia del entrenamiento de Modelos de Lenguaje Grandes Multimodales mediante la compresión dinámica de tokens visuales durante la alineación y la omisión de capas redundantes durante el ajuste de instrucciones para abordar diversas fuentes de redundancia computacional.

Autores originales: Kean Shi, Liang Chen, Haozhe Zhao, Baobao Chang

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kean Shi, Liang Chen, Haozhe Zhao, Baobao Chang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un estudiante brillante pero muy hambriento (la IA) a entender tanto imágenes como palabras. Este estudiante es un "Modelo de Lenguaje Grande Multimodal" (MLLM). El problema es que enseñar a este estudiante es increíblemente costoso y lento, porque el estudiante intenta mirar cada píxel individual en una foto y leer cada capa individual de su libro de texto, incluso cuando la mayor parte de esa información es solo ruido o repetición.

El artículo propone un nuevo método de entrenamiento llamado STS (Esquema de Entrenamiento Disperso). Piensa en STS no como un solo truco, sino como una astuta estrategia de entrenamiento en dos etapas que cambia su enfoque dependiendo de lo que el estudiante esté aprendiendo actualmente.

Así es como funciona, desglosado en analogías simples:

El Problema Central: "Demasiado Ruido"

Al entrenar estos modelos de IA, dos cosas desperdician mucho tiempo:

  1. Redundancia Visual: Una foto podría tener 10.000 píxeles, pero 8.000 de ellos son solo cielo azul o fondo vacío. La IA desperdicia energía procesando el cielo vacío.
  2. Redundancia de Capas: La IA tiene muchas "capas" de pensamiento (como capítulos en un libro). Al principio del entrenamiento, la IA no necesita leer cada capítulo individual para aprender lo básico.

El artículo argumenta que estas partes "desperdiciadas" no son las mismas en cada etapa del aprendizaje. Lo que desperdicia tiempo al principio es diferente de lo que desperdicia tiempo al final.

La Solución: Un Plan de Entrenamiento en Dos Etapas

Los autores diseñaron un sistema que cambia de táctica según la etapa de entrenamiento, como un entrenador que cambia el ejercicio dependiendo de si el atleta se está calentando o compitiendo.

Etapa 1: El "Filtro de Fotos" (Alineación de Modalidades)

La Situación: Al principio, la IA está aprendiendo a conectar imágenes con palabras. La parte de "lenguaje" de la IA está congelada (aún no está aprendiendo nuevas palabras), pero se está ahogando en demasiados detalles de las imágenes.
La Analogía: Imagina que le estás mostrando a un estudiante una película en 4K para explicar una historia. El estudiante se siente abrumado por la gran cantidad de fotogramas.
La Solución (Compresor de Tokens Visuales): En lugar de mostrar toda la película, el entrenador (STS) utiliza un filtro inteligente. Escanea rápidamente la imagen y dice: "Oye, esta parte es solo cielo azul, saltémosla. Esta parte es un rostro, mantengámosla".

  • Descarta las partes aburridas y repetitivas de la imagen antes de que la IA siquiera las mire.
  • Esto ahorra una cantidad masiva de energía justo al principio.

Etapa 2: El "Lector de Ojeada" (Ajuste de Instrucciones)

La Situación: Ahora la IA sabe cómo ver imágenes, y es hora de aprender a seguir instrucciones complejas y conversar. La parte de "lenguaje" de la IA está ahora activa y aprendiendo.
La Analogía: Imagina que el estudiante está leyendo un libro de texto grueso. Al principio, necesita leer cada palabra para entender lo básico. Pero a medida que se vuelve más inteligente, empieza a darse cuenta: "Ya sé los capítulos 1 y 2; puedo solo ojearlos y enfocarme en las cosas nuevas y difíciles del capítulo 10".
La Solución (Saltador Dinámico de Capas): El entrenador le dice a la IA: "Para esta lección específica, no necesitas usar toda tu potencia cerebral. Puedes saltar las primeras 'capas de pensamiento' y saltar directamente a las más profundas".

  • A medida que avanza el entrenamiento y la IA mejora, el entrenador gradualmente la hace leer más capas nuevamente.
  • Esto evita que la IA haga gimnasia mental innecesaria sobre cosas que ya entiende.

El Resultado: Más Rápido, Más Ligero y Aún Inteligente

El artículo probó este "Entrenamiento en Dos Etapas" en varios modelos de IA diferentes. Esto es lo que encontraron:

  • Ahorros Masivos: La IA utilizó aproximadamente un 17% menos de potencia de computación (FLOPs) para entrenar. Es como terminar un maratón en un 17% menos de tiempo.
  • Sin Caída Importante en la Inteligencia: A pesar de saltarse tanto trabajo, la IA aún obtuvo del 97% al 99% de las puntuaciones en las pruebas que habría obtenido si hubiera hecho todo el trabajo.
  • Enfoque Equilibrado: El artículo encontró que si solo usabas el "Filtro de Fotos" o solo usabas el "Lector de Ojeada", los resultados no eran tan buenos. Necesitas ambas estrategias trabajando juntas en los momentos adecuados para obtener el mejor equilibrio entre velocidad e inteligencia.

En Resumen

El artículo dice: "No trates el proceso de entrenamiento de la IA como un largo y aburrido arrastre. Trátalo como un viaje con diferentes terrenos. Cuando la IA esté mirando imágenes, ayúdala a ignorar el ruido de fondo. Cuando la IA esté aprendiendo a hablar, permítele saltar los capítulos que ya conoce. Al hacer esto, podemos entrenar modelos de IA súper inteligentes mucho más rápido sin que pierdan su cerebro".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →