← Últimos artículos
💬 NLP

PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning

El artículo propone PALS, un método de poda de un solo paso (one-shot) que ajusta dinámicamente las proporciones de dispersión a través de las capas del transformer basándose en las magnitudes de activación, logrando mejoras significativas en la perplejidad sobre la poda uniforme en LLaMA-2-7B al demostrar que la asignación basada en gradientes es ineficaz para la eliminación discreta de pesos.

Autores originales: Yazdan Jamshidi, Alexey Shvets

Publicado 2026-07-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yazdan Jamshidi, Alexey Shvets

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante e increíblemente inteligente (un Modelo de Lenguaje Extenso) con miles de millones de libros (parámetros). Para hacer que esta biblioteca quepa en una pequeña mochila para que puedas llevarla contigo en tu teléfono, necesitas tirar la mitad de los libros. Esto se llama "poda" (pruning).

El problema es que no todos los libros son igual de importantes. Algunos son solo relleno, mientras que otros contienen los mapas y las llaves más críticos para comprender el mundo.

La forma antigua: El enfoque de "talla única"

Los métodos anteriores (como Wanda y SparseGPT) eran como un bibliotecario estricto que dice: "Necesitamos eliminar el 50% de los libros. Así que tiraremos exactamente la mitad de los libros de cada estante, sin importar qué".

Los autores de este artículo argumentan que esto es una tontería. Algunos estantes (capas) están llenos de información vital y única, mientras que otros están llenos de notas repetitivas. Si cortas el 50% de los estantes vitales, la biblioteca deja de tener sentido. Si cortas el 50% de los estantes repetitivos, nadie lo nota.

La nueva forma: PALS (El "Bibliotecario Inteligente")

Los autores proponen un nuevo método llamado PALS (Sparsidad por Capas Consciente de Percentiles). En lugar de cortar la misma cantidad de cada estante, PALS actúa como un bibliotecario inteligente que observa los estantes primero.

Cómo funciona:

  1. La comprobación de "valores atípicos": El bibliotecario mira los libros de cada estante y pregunta: "¿Hay algún libro aquí que sea radicalmente diferente o extremadamente ruidoso?". En términos técnicos, buscan valores atípicos de activación (activation outliers): momentos en los que una parte específica del modelo se vuelve muy "entusiasta" o activa.
  2. La regla:
    • Si un estante tiene estos momentos "ruidosos" o "entusiastas", significa que ese estante está realizando un trabajo crítico. No cortes mucho aquí. Conserva más libros.
    • Si un estante es silencioso y uniforme, probablemente esté realizando un trabajo repetitivo. Corta más aquí. Tira más libros.
  3. La red de seguridad: Para asegurarse de no volverse demasiado locos, el bibliotecario tiene una regla: "Solo puedes cambiar la cantidad de corte en una cantidad mínima (más o menos un 5%)". Esto evita que accidentalmente vacíen un estante vital o dejen un estante inútil completamente lleno.

La gran sorpresa: La trampa del "Gradiente"

Antes de decidirse por la "fuerza" de los libros, los investigadores probaron una idea diferente. Pensaron: "Tal vez deberíamos mirar los gradientes".

En el mundo de la IA, los "gradientes" son como un mapa que muestra hacia dónde ajustar un libro para hacerlo ligeramente mejor. Por lo general, esta es una forma muy inteligente de decidir qué conservar.

Pero aquí está la sorpresa: Cuando usaron los gradientes para decidir qué cortar, la biblioteca se desmoronó. Los resultados fueron peores que si simplemente hubieran tirado los libros al azar.

¿Por qué? Los autores suponen que los gradientes son como un mapa para dar pasos diminutos, muy, muy pequeños. Pero la poda es como dar un paso gigante, masivo (eliminar el 50% de los libros de una vez). Un mapa que funciona para pasos pequeños no te dice qué sucede cuando eliminas la mitad del terreno. Es como saber hacia dónde se inclina una colina no te dice qué pasará si demueles la mitad de la montaña.

Los resultados

  • En modelos más antiguos (LLaMA-2): El "Bibliotecario Inteligente" (PALS) hizo un trabajo fantástico. La biblioteca redujo su tamaño a la mitad pero seguía entendiendo el lenguaje casi tan bien como la versión completa. Fue mucho más inteligente que el método de "talla única".
  • En modelos más nuevos (Mistral, LLaMA-3): El "Bibliotecario Inteligente" no ayudó mucho. Los autores piensan que esto se debe a que estos modelos más nuevos están tan bien entrenados que cada estante es ya igual de importante. No hay un estante "redundante" del cual se pueda cortar más, por lo que la estrategia inteligente no puede encontrar una ventaja.

La conclusión

PALS es un truco simple y económico para hacer que los modelos de IA sean más pequeños sin perder su inteligencia. Funciona escuchando qué partes del modelo están "gritando" (alta actividad) y protegiéndolas, mientras recorta las partes silenciosas.

También nos enseña una lección valiosa: Solo porque un método (como los gradientes) funcione para pequeños ajustes, no significa que funcione para grandes recortes. A veces, la señal más simple (observar qué tan activa está una parte en este momento) es mejor que la matemática más compleja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →