← Últimos artículos
💻 computer science

SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs

SHIFT-LLM es un marco de post-poda libre de entrenamiento que restaura la precisión en modelos de lenguaje de gran tamaño podados en profundidad mediante la inserción de adaptadores residuales lineales ligeros calibrados vía regresión de forma cerrada para corregir los desplazamientos distribucionales causados por la eliminación de bloques Transformer.

Autores originales: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los motores detrás de muchas de las herramientas de inteligencia artificial más avanzadas de la actualidad, capaces de escribir historias, resolver problemas y responder preguntas complejas. Estos sistemas están construidos a partir de capas de unidades de procesamiento digital apiladas una sobre otra, muy parecido a un edificio de varios pisos donde cada planta refina la información pasada desde la que está debajo. Cuantos más pisos tiene un edificio, más detallada y sofisticada puede ser su producción final, pero esto también hace que la estructura sea increíblemente pesosa y costosa de operar. Para muchas aplicaciones prácticas, especialmente en dispositivos con potencia o memoria limitadas, estos modelos masivos son simplemente demasiado grandes para ser utilizados. Para hacerlos más pequeños, los investigadores han desarrollado métodos para eliminar pisos enteros del edificio, un proceso conocido como poda de profundidad (depth pruning). Si bien esto logra aligerar la carga y acelerar el modelo, a menudo hace que las plantas restantes tropiecen. Debido a que las plantas eliminadas fueron diseñadas para pasar tipos específicos de información a las que están arriba, quitarlas deja a las capas superiores confundidas, recibiendo señales que ya no coinciden con lo que estaban entrenadas para esperar. Este desajuste, conocido como un cambio de distribución (distribution shift), provoca que el modelo pierda precisión y cometa errores, obligando a los desarrolladores a dedicar una cantidad significativa de tiempo y potencia de cómputo para reentrenar el modelo y corregir los errores.

Un equipo de investigadores de Huawei Noah's Ark Lab ha introduído un nuevo enfoque llamado SHIFT-LLM que resuelve este problema sin la necesidad de reentrenamiento. En lugar de intentar reconstruir los pisos faltantes o reenseñar a los restantes, su método inserta un módulo de corrección pequeño y ligero en cada punto donde se eliminó una capa. Imagine que si usted eliminara un piso de un edificio, instalaría una rampa sencilla y hecha a medida que conecte perfectamente el hueco, asegurando que las personas en los pisos superiores sigan recibiendo exactamente las mismas instrucciones que recibirían si el piso faltante todavía estuviera allí. En el mundo digital, esta rampa es un adaptador lineal que preserva el camino directo de la información mientras añade un ajuste pequeño y calculado. Este ajuste está diseñado para imitar la contribución específica que la capa eliminada habría aportado, engañando efectivamente al resto del modelo para que crea que el piso faltante aún está presente.

La brillantez de este método reside en cómo calcula ese ajuste. En lugar de ejecutar miles de horas de entrenamiento para determinar qué debería haber hecho la capa faltante, los investigadores utilizan un pequeño conjunto de datos de muestra para medir exactamente qué información se perdió. Luego, utilizan un cálculo matemático sencillo para determinar la corrección precisa necesaria para restaurar esa información perdida. Este proceso es completamente automático y no requiere optimización basada en gradientes, que es el complejo proceso iterativo de aprendizaje que normalmente se requiere para arreglar modelos rotos. Al utilizar este cálculo de forma cerrada (closed-form calculation), el equipo puede corregir el estado interno del modelo en cuestión de minutos utilizando solo unos pocos cientos de ejemplos, en lugar de días de tiempo de cómputo. El resultado es un modelo podado que conserva la velocidad y eficiencia de tener menos capas, pero funciona con una precisión casi idéntica a la del modelo masivo original.

En sus experimentos, los investigadores probaron esta técnica en cinco familias diferentes de modelos de lenguaje extensos, que van desde modelos más pequeños de 1.500 millones de parámetros hasta versiones más grandes de 14.000 millones de parámetros. Aplicaron seis métodos diferentes para decidir qué capas eliminar y evaluaron los resultados en siete bancos de pruebas (benchmarks) diseñados para probar el conocimiento general y el razonamiento. Los hallazgos fueron consistentes: los módulos de corrección recuperaron con éxito la precisión perdida durante la poda en casi todas las configuraciones. En un caso notable que involucró un modelo de 8.000 millones de parámetros, el método recuperó la asombrosa cifra de 15,7 puntos de precisión en un banco de pruebas estándar, una ganancia que típicamente requeriría un reentrenamiento extenso y costoso. Incluso cuando los modelos ya estaban siendo ajustados (fine-tuned) después de la poda, añadir este módulo de corrección proporcionó un impulso adicional, lo que sugiere que ambos enfoques funcionan bien juntos para elevar el rendimiento aún más.

Los investigadores también demostraron que estos módulos de corrección pueden comprimirse aún más para ahorrar espacio y fusionarse cuando se eliminan varias capas de forma consecutiva, asegurando que las ganancias de eficiencia de la poda no se pierdan debido a la sobrecarga del arreglo mismo. Este trabajo sugiere que el obstosáculo principal para hacer que los modelos de lenguaje extensos sean más pequeños no es solo la eliminación de partes, sino la interrupción del flujo de información entre ellas. Al enfocarse en reparar ese flujo con ajustes sencillos y dirigidos, SHIFT-LLM ofrece una forma general y eficiente de hacer que los modelos de IA potentes sean prácticos para el uso diario. El estudio confirma que, con la corrección adecuada, podemos despojar a estos cerebros digitales de las partes pesadas y redundantes sin perder su capacidad de pensar con claridad, abriendo la puerta a una inteligencia artificial más rápida, barata y accesible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →