← Últimos artículos
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

El artículo presenta SubFit, un método de compresión de LLM post-entrenamiento que supera las limitaciones de los enfoques actuales basados en capas al permitir la selección de componentes de Atención y FeedForward a nivel de submódulo y no contiguos con bypasses residuales ajustados individualmente, logrando así una relación superior entre precisión-perplejidad y eficiencia de inferencia a través de varios modelos y niveles de dispersión.

Autores originales: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

Publicado 2026-06-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un Modelo de Lenguaje Grande (LLM) como una enorme y sofisticada línea de montaje de una fábrica. Esta fábrica tiene cientos de estaciones de trabajo idénticas (capas), y cada estación tiene dos trabajadores principales: uno que se especializa en la Atención (observar el contexto y conectar ideas) y otro que se especializa en FeedForward (procesar y transformar esas ideas).

Para que esta fábrica funcione más rápido y consuma menos electricidad (memoria), quieres eliminar algunas de estas estaciones de trabajo. Pero aquí está el problema: si simplemente arrancas una estación de trabajo del medio de la línea, el producto (la respuesta de la IA) se desmorona porque el flujo de información se interrumpe.

La vieja forma: "La demolición de vecindarios"

Los métodos anteriores intentaban resolver esto eligiendo un bloque contiguo de estaciones de trabajo (por ejemplo, las capas 10 a 15) y eliminándolas todas a la vez. Luego, intentaban construir un único "túnel de acceso directo" pequeño para reemplazar todo ese bloque.

Los autores de este artículo argumentan que esto es como intentar arreglar un vecindario derribando toda una fila de casas y construyendo un pequeño cobertizo para reemplazarlas. Es demasiado tosco. Se dieron cuenta de que:

  1. La redundancia no es ordenada: El trabajo "extra" que se puede eliminar no siempre está en una fila consecutente y ordenada. Algunas estaciones de trabajo en medio de la línea están haciendo muy poco, mientras que otras cercanas están haciendo mucho.
  2. Diferentes trabajadores necesitan diferentes arreglos: El trabajador de "Atención" y el trabajador de "FeedForward" son diferentes. Necesitan tipos de atajos distintos para ser reemplazados de manera efectiva.

La nueva forma: "SUBFIT" (El trabajo de parche personalizado)

El artículo presenta un método llamado SUBFIT. En lugar de derribar vecindarios enteros, SUBFIT actúa como un maestro sastre o un cirujano.

  1. Recortar y parchar, no demoler: Observa cada una de las estaciones de trabajo individualmente, independientemente de dónde se encuentre en la línea. Selecciona aquellas que están realizando la menor cantidad de trabajo único (las "redundantes") y las elimina. Estas no tienen que estar una al lado de la otra; pueden estar dispersas por toda la fábrica.
  2. Desvíos hechos a medida: Para cada estación de trabajo que elimina, cose un pequeño "desvío" personalizado (un atajo).
    • Para los trabajadores de Atención: Utiliza un atajo de rango muy bajo y muy simple (como un sendero estrecho).
    • Para los trabajadores de FeedForward: Utiliza un camino ligeramente más complejo, pero aquí está el truco ingenioso: comparte el "plano" de este camino entre todos los trabajadores de FeedForward eliminados. Esto ahorra una enorme cantidad de espacio, como usar una llave maestra para abrir muchas puertas diferentes.

Los resultados: Más rápidos, más pequeños y aún inteligentes

Los autores probaron este método en diez modelos de IA (tanto básicos como entrenados para seguir instrucciones). Compararon SUBFIT con los antiguos métodos de "demolición de vecindarios".

  • El intercambio (Trade-off): Normalmente, cuando se comprime una IA, esta se vuelve más rápida pero comienza a cometer más errores (mayor "perplejidad" y menor "precisión").
  • El ganador: SUBFIT mantuvo a la IA mucho más inteligente que los métodos antiguos. Con un nivel de compresión del 25% (eliminando una cuarta parte de las estaciones de trabajo), los métodos antiguos cayeron a aproximadamente el 81% de su inteligencia original. SUBFIT se mantuvo en el 84.6%.
  • La prueba "agresiva": Cuando intentaron comprimir los modelos aún más (37.5%), los métodos antiguos colapsaron por completo. SUBFIT resistió mucho mejor.
  • Velocidad: Debido a que realmente eliminaron la maquinaria pesada (los submódulos), la fábrica funciona más rápido. La IA genera su primera palabra más rápido y utiliza menos memoria (caché KV) para recordar la conversación.

La conclusión fundamental

El artículo afirma que al cambiar la "granularidad" (el tamaño de las piezas que se recortan) de capas completas a componentes individuales, y al tratar esos componentes de manera diferente según lo que hacen, se pueden reducir significamente los modelos de IA sin perder tanto de su capacidad intelectual.

Es como darse cuenta de que no necesitas reemplazar todo el bloque del motor para reducir el peso; solo necesitas quitar cuidadosamente los pernos pesados específicos que no están haciendo mucho trabajo y reemplazarlos con espaciadores ligeros y hechos a medida. El resultado es un motor más ligero que sigue funcionando con la misma fluidez.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →