← Últimos artículos
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

El artículo introduce MoP (Mixture of Pruners), un marco iterativo que unifica la poda de profundidad y anchura para superar a los métodos existentes de una sola dimensión en términos de precisión y reducción de latencia en los modelos LLaMA y LLaVA.

Autores originales: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
Publicado 2026-07-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando cargar una biblioteca masiva y pesada en una mochila. Esta biblioteca contiene la suma del conocimiento humano, escrita en un lenguaje tan complejo que solo las computadoras más inteligentes pueden leerlo. Estas "bibliotecas" se llaman Modelos de Lenguaje Extensos (LLM). Son increíbles escribiendo historias, resolviendo problemas matemáticos e incluso charlando como un amigo. Pero hay un inconveniente: son tan grandes y pesadas que requieren cantidades enormes de electricidad y computadoras superrápidas solo para abrir el libro y leer una sola oración. Si quieres usarlas en una computadora portátil normal o en un teléfono, a menudo son demasiado lentas y pesadas para cargarlas.

Para solucionar esto, los científicos han estado intentando hacer estas bibliotecas más pequeñas sin tirar los libros importantes. Una forma de hacer esto es la "poda". Piensa en la poda como la jardinería. Tienes un arbusto gigante y excesivamente crecido (el modelo de computadora grande), y quieres recortarlo para darle una forma más pequeña y cuidada. Puedes cortar ramas enteras (haciendo el arbusto más corto) o puedes recortar las hojas de las ramas (haciendo el arbusto más delgado). Durante mucho tiempo, los jardineros tenían que elegir: o cortaban ramas enteras o recortaban las hojas, pero no ambas cosas al mismo tiempo. La pregunta era, ¿qué forma de recortar hace que el arbusto sea más pequeño manteniendo su salud y capacidad de dar frutos?

Este artículo presenta una nueva herramienta de jardinería llamada MoP, que significa Mixture of Pruners (Mezcla de Podadores). En lugar de elegir solo una forma de recortar, MoP es un jardinero inteligente e iterativo que intenta ambos métodos en cada paso. Imagina que estás recortando tu arbusto. En cada corte, MoP hace dos preguntas: "¿Cómo se ve el arbusto si corto esta rama entera?" y "¿Cómo se ve si en su lugar recorto las hojas de esta rama?". Luego elige la versión que mantiene el arbusto con el aspecto más parecido a la planta original y saludable. Repite este proceso, alternando entre cortar ramas y recortar hojas, hasta que el arbusto es lo suficientemente pequeño como para caber en tu mochila.

Los investigadores probaron este método en algunos de los cerebros de computadora más inteligentes del mundo, como los modelos LLaMA-2 y LLaMA-3. Descubrieron que MoP es mucho mejor para encoger estos modelos que usar un solo método por sí solo. Cuando recortaron los modelos en un 40% (haciéndolos un 40% más pequeños), MoP mantuvo los modelos tan inteligentes como la competencia, pero también hizo que funcionaran significativamente más rápido. De hecho, los modelos fueron un 39% más rápidos al responder preguntas. Lo que es aún más sorprendente, probaron esto en un modelo que puede ver imágenes y leer texto (llamado LLaVA-1.5). Descubrieron que, aunque solo "enseñaron" al modelo recortado con texto (sin imágenes), el modelo aún podía entender imágenes casi tan bien como antes. Esto sugiere que mezclar las dos estrategias de recorte crea un cerebro de computadora más pequeño, rápido y listo que no pierde el rumbo, incluso cuando se vuelve muy pequeño.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →