← Últimos artículos
💻 computer science

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune es un marco de trabajo libre de entrenamiento y plug-and-play que reduce eficientemente los costos computacionales en modelos de lenguaje grandes multimodales mediante el uso de tokens separadores de modalidad como consultas unificadas para podar el 80.2% de los tokens de visión mientras retiene el 96.3% de la precisión original.

Autores originales: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

Publicado 2026-07-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente a ver y hablar al mismo tiempo. Este es el mundo de los Modelos de Lenguaje de Gran Escala Multimodales (MLLM), las estrellas de la IA que pueden mirar la foto de un atardecer y escribir un poema sobre él, o analizar un gráfico complejo y responder preguntas al respecto. Para hacer esto, el robot no solo "mira" la imagen; la descompone en miles de diminutas piezas de rompecabezas digitales llamadas "tokens de visión". Piensa en estos tokens como píxeles individuales, pero mucho más inteligentes: portan todos los detalles de la imagen.

Sin embargo, hay un inconveniente. Cuando le proporcionas al robot una foto de alta definición o un video largo, este genera tantos de estos tokens que el robot se siente abrumado. Es como intentar leer una biblioteca de libros toda a la vez; el proceso se vuelve lento, costoso e ineficiente. Los científicos han estado tratando de solucionar esto intentando averiguar qué piezas del rompecabezas son realmente importantes y cuáles son solo estorbo. Algunos métodos intentan adivinar la importancia observando cómo el robot presta atención a las palabras, mientras que otros intentan encontrar piezas duplicadas. Pero estos enfoques a menudo se quedan estancados en su propia complejidad, ralentizando al robot incluso más mientras intentan acelerarlo. La gran pregunta sigue siendo: ¿cómo eliminamos el estorbo sin perder la imagen?

Presentamos SepPrune, un nuevo método que actúa como un editor ingenioso para estos modelos de IA. Los investigadores detrás de este trabajo notaron algo fascinante mientras observaban cómo estos modelos piensan. Descubrieron que, en las etapas iniciales del procesamiento, el modelo presta una enorme cantidad de atención a unos tokens "separadores" especiales: pequeños marcadores que se sitúan entre los datos de la imagen y los datos del texto, actuando como un puente entre estos dos mundos. Resulta que estos separadores son la clave para comprender la imagen.

En lugar de intentar calcular la importancia de cada uno de los tokens de visión comparándolos entre sí (lo cual es lento y desordenado), SepPrune utiliza el token separador como una consulta maestra. Imagina al separador como un guía turístico parado en la entrada de un museo. En lugar de preguntarle a cada pintura: "¿Eres importante?", el guía mira toda la sala y señala: "Tú, tú y tú son las obras maestras; el resto puede esperar". Al utilizar el separador para calificar rápidamente los tokens de visión, SepPrune puede identificar instantáneamente las piezas más informativas de la imagen y descartar el resto.

Los resultados son impresionantes. Al ser probado en modelos potentes como Qwen2.5-VL-7B, SepPrune logró desechar más del 80% de los tokens de visión manteniendo un 96.3% de la precisión original del modelo. Incluso cuando la poda se llevó al extremo de una reducción del 90.2%, el modelo retuvo el 87.2% de su rendimiento. Este es un salto significativo en comparación con otros métodos, que a menudo luchan por mantener una precisión tan alta cuando realizan recortes tan profundos. Además, debido a que este método no requiere cálculos complejos entre cada token, es mucho más rápido y funciona a la perfección con las tecnologías de aceleración existentes.

Los investigadores también demostraron que sus elecciones específicas importan. Mostraron que usar el token separador como el "guía" funciona mejor que usar otras partes del texto, y que ignorar la "posición" de los tokens (dónde se encuentran en la imagen) durante el proceso de selección evita que el modelo mantenga accidentalmente solo la mitad inferior de una imagen. En resumen, SepPrune sugiere que, al escuchar el puente entre la imagen y el texto, podemos hacer que estos visionarios de la IA sean más rápidos y eficientes sin cegarlos ante los detalles que realmente importan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →