← Últimos artículos
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

El artículo presenta LEAP, un método de poda adaptativa aprendible de extremo a extremo que utiliza una relajación de Bernoulli por peso mediante sigmoide de Gumbel para permitir el aprendizaje de dispersión no estructurada tratable en modelos de lenguaje grandes, superando significativamente a las líneas base existentes por capa en precisión de cero disparos a niveles altos de dispersión.

Autores originales: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva e increíblemente inteligente (un Modelo de Lenguaje Grande) que lo sabe casi todo. Pero esta biblioteca es tan enorme que ocupa un almacén completo, requiere una central eléctrica gigante para funcionar y es demasiado lenta para que cualquiera la utilice realmente en una computadora regular.

Para solucionar esto, quieres deshacerte del 50% al 60% de los libros (los "pesos" o conexiones en el modelo) para hacerla más pequeña y rápida. El objetivo es mantener la biblioteca igual de inteligente, incluso con la mitad de los libros.

Aquí es donde entra el artículo LEAP. Esta es la historia de cómo resolvieron el problema, explicada de forma sencilla:

El Problema: La Trampa de "Demasiadas Opciones"

Durante mucho tiempo, los científicos intentaron eliminar libros utilizando dos estrategias principales:

  1. El Enfoque "Capa por Capa" (La Vieja Forma): Imagina a un bibliotecario que mira un estante a la vez y decide: "Este libro parece inútil, tíralo". Lo hacen para cada estante sin hablar con los otros estantes.

    • El Defecto: A veces un libro parece inútil en su propio estante, pero es realmente crucial para una historia que abarca toda la biblioteca. Al observar los estantes de forma aislada, este método tira accidentalmente conexiones importantes, haciendo que la biblioteca sea menos inteligente.
  2. El Enfoque de "Patrón" (La Forma Más Nueva, Rota): Recientemente, algunos investigadores intentaron mirar toda la biblioteca de una vez. Dijeron: "Aprendamos exactamente qué libros mantener". Pero intentaron hacerlo agrupando libros en pequeños conjuntos (como 4 libros a la vez) y preguntando: "¿Qué patrón de estos 4 deberíamos mantener?"

    • El Defecto: Esto funciona genial para grupos pequeños. Pero si intentas hacer esto para una fila completa de 4.000 libros (que es lo que tienen los modelos de IA modernos), el número de posibles "patrones" se convierte en un número tan enorme que es imposible escribirlo. Es como intentar listar cada combinación posible de números de lotería para mil millones de boletos. La computadora se ahoga; las matemáticas se rompen.

La Solución: LEAP (El Sistema de "Voto Individual")

Los autores de este artículo, LEAP, se dieron cuenta de que necesitaban una nueva forma de votar sobre qué libros mantener sin abrumarse con las matemáticas.

En lugar de preguntar: "¿Qué patrón de grupo mantenemos?" (lo cual es imposible para grupos enormes), hicieron una pregunta mucho más sencilla para cada libro individual: "¿Debe quedarse o irse este libro específico?"

  • La Analogía: Imagina una elección masiva donde cada votante individual (cada peso en el modelo) recibe una papeleta diminuta. En lugar de votar por una compleja "estrategia de equipo", simplemente votan "Sí" (mantener) o "No" (desechar).
  • El Truco Mágico: Para que esto funcione, utilizaron un truco matemático (llamado "Gumbel-sigmoid") que permite que la computadora "adivine" los votos suavemente al principio, y luego haga esas adivinanzas progresivamente más duras y nítidas hasta que cada voto sea un claro "Sí" o "No".

Cómo lo Hicieron (La Receta)

No empezaron desde cero. Utilizaron un punto de partida inteligente:

  1. El Inicio Cálido: Primero utilizaron un método rápido y sencillo (llamado Wanda) para obtener una idea aproximada de qué libros eran probablemente inútiles. Lo usaron como un "empuje inicial" para que la computadora no tuviera que adivinar a ciegas.
  2. El Entrenamiento: Dejaron que la computadora "aprendiera" el mejor conjunto de votos leyendo una pequeña cantidad de texto (un flujo de calibración) y ajustando los votos "Sí/No" para mantener alta la inteligencia de la biblioteca.
  3. Congelar los Libros: Crucialmente, no cambiaron las palabras dentro de los libros (los pesos del modelo). Solo cambiaron la decisión de qué libros mantener. Esto mantiene intacta la "personalidad" y el conocimiento originales de la biblioteca, solo en un paquete más pequeño.

Los Resultados: Más Inteligente, Más Rápido, Más Delgado

Probaron esto en cinco modelos de IA famosos diferentes (que van desde pequeños hasta muy grandes) y los redujeron un 50% y un 60%.

  • La Puntuación: Compararon LEAP con los mejores métodos existentes.
  • La Victoria: LEAP fue consistentemente mejor. En promedio, mejoró la precisión del modelo en 2.59 puntos sobre el mejor método anterior. En algunos casos, la mejora fue tan alta como 5.40 puntos.
  • La Velocidad: Como cortaron el modelo de una manera que encaja perfectamente con nuevos y rápidos chips de computadora (GPUs) diseñados para este trabajo exacto, el modelo resultante funciona mucho más rápido sin perder su inteligencia.

Por Qué Esto Importa

Antes de esto, si querías hacer un modelo de IA gigante más pequeño y rápido, tenías que elegir entre:

  • Opción A: Mantenerlo preciso pero enorme y lento.
  • Opción B: Hacerlo pequeño y rápido, pero tonto.

LEAP muestra que puedes tener tu pastel y comerlo también. Proporciona una forma práctica de reducir estos cerebros masivos de IA a la mitad, manteniéndolos igual de inteligentes, para que puedan ejecutarse en computadoras regulares en lugar de necesitar una supercomputadora.

En resumen: LEAP es una nueva y más inteligente forma de editar un modelo de IA gigante permitiendo que cada conexión individual vote sobre si debe quedarse, resultando en una IA más pequeña, más rápida y aún muy inteligente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →