← Últimos artículos
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

El artículo presenta WIDE, el primer marco diferenciable de extremo a extremo que permite la poda de ancho dinámica a nivel de token para LLMs mediante la selección de grano fino de cabezales de atención y canales FFN, junto con un codiseño de kernel especializado para lograr una aceleración de inferencia de extremo a extremo significativa manteniendo una alta precisión.

Autores originales: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

Publicado 2026-07-31
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando ejecutar un cerebro robótico masivo e increíblemente inteligente en un dispositivo diminuto que funciona con batería. Este cerebro robótico es un Modelo de Lenguaje Grande (LLM), un tipo de inteligencia artificial que puede escribir historias, resolver problemas matemáticos y charlar como un humano. Pero aquí está el truco: estos cerebros son enormes. Son tan grandes y hambrientos de energía que normalmente necesitan supercomputadoras para funcionar, lo que los hace lentos y costosos de usar en tu teléfono o computadora portátil.

Para solucionar esto, los científicos han estado intentando "podar" estos cerebros. Piensa en la poda como recortar un seto gigante y excesivamente crecido. Cortas las ramas que no están haciendo mucho trabajo para que la planta sea más pequeña y rápida. Durante mucho tiempo, la mejor manera de hacer esto era cortar secciones enteras del seto de forma permanente, sin importar lo que la planta intentara hacer ese día. Pero esto es un poco torpe; a veces cortas una rama que era necesaria para una tarea específica, haciendo que el robot se vuelva olvidadizo. Recientemente, se inventaron métodos más inteligentes que permiten al robot decidir mientras está pensando qué partes utilizar. Sin embargo, estos métodos inteligentes todavía eran un poco toscos: o usaban una sección completa o la saltaban por completo, como decidir si usar una habitación entera o dejar la casa vacía, en lugar de solo encender algunas luces específicas.

Este artículo presenta un nuevo sistema llamado WIDE (Inferencia basada en el Ancho con Ejecución Dinámica). Es como darle al robot un interruptor de regulación de intensidad superpreciso para cada bombilla de su cerebro. En lugar de encender o apagar habitaciones enteras, WIDE permite al robot decidir, para cada palabra que procesa, exactamente qué pequeños grupos de neuronas (las células del cerebro) deben iluminarse y cuáles deben permanecer a oscuras. Los investigadores construyeron un "controlador de tráfico" especial (un enrutador) que aprende a tomar estas decisiones en fracciones de segundo. También diseñaron una nueva forma para que el hardware de la computadora maneje estas decisiones sin confundirse ni ralentizarse. El resultado es que el robot sigue siendo tan inteligente como antes, pero funciona mucho más rápido y consume menos energía, incluso cuando le han cortado la mitad de la capacidad de su cerebro.

El Problema: La Trampa del "Todo o Nada"

Imagina que eres un chef dirigiendo una cocina masiva. Tienes cientos de chefs (neuronas) trabajando juntos para cocinar una comida. En los viejos tiempos, si querías ahorrar tiempo, podrías despedir a la mitad del personal de la cocina permanentemente. Esto funciona bien si siempre estás cocinando el mismo plato sencillo, pero si de repente necesitas hornear un pastel complejo, es posible que hayas despedido al único panadero que necesitabas. Esto es lo que sucede con la poda estática: el modelo se recorta una vez y para siempre, independientemente de la pregunta específica que esté responlando.

Luego vino la poda dinámica, que era como contratar a un gerente que podía decirle a los chefs: "Oigan, para este pedido específico, solo se necesita la estación de parrilla; la panadería puede tomar un descanso". Esto fue mejor, pero el gerente seguía siendo un poco torpe. Decían: "Salta toda la panadería", incluso si la panadería solo necesitaba usar dos hornos de diez. Era una decisión de "todo o nada" para grandes trozos de la cocina.

El problema es que los modelos de IA modernos son tan complejos que saltarse un trozo entero a menudo descarta información útil, perjudicando la calidad de la respuesta. Además, si el gerente sigue cambiando el horario cada segundo, el personal de la cocina se confunde y la velocidad real de la cocina no aumenta mucho debido a toda la sobrecarga por el cambio constante.

La Solución: El "Regulador de Intensidad" de WIDE

Los autores de este artículo, trabajando en el Instituto Ningbo de Digital Twin y la LMU de Munich, idearon WIDE. En lugar de despedir departamentos enteros o saltarse habitaciones completas, WIDE permite que el modelo decida, para cada palabra (token) que procesa, exactamente qué pequeños grupos de neuronas activar.

Piensa en el cerebro del modelo como una gigantesca cuadrícula de interruptores de luz.

  • Métodos Dinámicos Antiguos: "Apaga todo el ala izquierda de la casa".
  • WIDE: "Para esta palabra específica, enciende las luces de la cocina, pero solo las que están sobre la estufa y el refrigerador. Deja el resto de la cocina a oscuras".

WIDE hace esto utilizando un "enrutador" ligero (un pequeño tomador de decisiones) conectado a cada capa del modelo. Este enrutador observa la palabra actual y pregunta: "¿Necesito este grupo de cabezales de atención (las partes que miran otras palabras)?" y "¿Necesito este grupo de canales FFN (las partes que procesan el significado)?". Toma una decisión binaria: usa este grupo o sáltatelo.

Crucialmente, WIDE no se detiene solo en la toma de decisiones; resuelve el dolor de cabeza del hardware. Normalmente, si le dices a una computadora que se salte partes aleatorias de un cálculo, la computadora se queda trabada tratando de averiguar dónde están los datos. WIDE utiliza un truco ingenioso llamado reordenación de máscara. Imagina que tienes una pila desordenada de correo donde algunas cartas son para entrega y otras son basura. En lugar de tirar la basura primero y luego intentar clasificar el correo, WIDE primero baraja la pila para que todas las cartas de "mantener" estén en la parte superior en un bloque ordenado, y todas las de "basura" estén en la parte inferior. Esto permite que la computadora procese el bloque de "mantener" de manera muy eficiente sin detenerse a revisar cada pieza de correo.

Lo que Encontraron: Velocidad e Inteligencia

Los investigadores probaron WIDE en modelos de IA populares como Llama 3.1 (8 mil millones de parámetros) y Llama 3.2 (3 mil millones de parámetros). Compararon su rendimiento contra los mejores métodos existentes tanto de poda estática como dinámica.

Esto es lo que sugieren los números:

  • Poda más Inteligente: Cuando recortaron el 50% de la capacidad del modelo (un recorte muy agresivo), WIDE mantuvo la inteligencia del modelo mucho mejor que cualquier otro método. Por ejemplo, en el modelo Llama 3.1, WIDE conservó el 86.42% de la precisión original tras la poda, mientras que el siguiente mejor método dinámico (SkipGPT) solo mantuvo el 59.42%. Incluso sin un ajuste fino adicional, WIDE ya estaba superando a los mejores métodos estáticos.
  • Velocidad en el Mundo Real: El artículo midió qué tan rápido funcionaba realmente el modelo. Para la etapa de "prefill" (leer un prompt largo), WIDE fue 1.68 veces más rápido que el modelo original. Para la etapa de "decode" (generar la respuesta palabra por palabra), fue 1.55 veces más rápido.
  • Magia a Nivel de Kernel: Si observamos solo los cálculos matemáticos (ignorando otras sobrecargas), la aceleración fue aún más dramática, alcanzando hasta 1.98x para prefill y 4.95x para decoding. Esto sugiere que el cuello de botella era la forma ineficiente en que los métodos anteriores manejaban el "saltarse" partes, y el nuevo diseño de hardware de WIDE solucionó eso.

Los autores también descubrieron que el modelo aprendió a ser muy estratégico. No se limitó a saltarse partes al azar; aprendió a saltarse las palabras "aburridas" (como "el" o "un") y a mantener las palabras "importantes" (como "corriendo" o "pista"). En una prueba, el modelo se saltó el 66% del trabajo de atención pero solo el 28% del trabajo de procesamiento, demostando que sabía exactamente dónde ahorrar energía.

La Conclusión

WIDE sugiere que el futuro de la IA eficiente no se trata solo de hacer el modelo más pequeño, sino de hacer que el modelo sea más inteligente sobre cómo utiliza sus partes restantes. Al pasar de "saltarse la habitación completa" a "regular la intensidad de las luces específicas", y al rediseñar la cocina para manejar estos reguladores de manera eficiente, los autores han creado un marco que hace que los modelos de IA grandes sean significativamente más rápidos y eficientes sin volverlos olvidadizos.

Aunque los resultados son prometedores, el artículo señala que esta es una solución específica para el hardware GPU (los chips en las computadoras) y depende de un proceso de entrenamiento de dos etapas donde el modelo primero aprende a tomar decisiones y luego recibe un ajuste rápido para recuperar cualquier precisión perdida. Es un paso significativo hacia la accesibilidad de la IA potente en dispositivos cotidianos, demostando que no necesitas un cerebro gigante para ser inteligente, solo necesitas saber qué partes de tu cerebro usar en el momento adecuado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →