← Últimos artículos
🤖 machine learning

Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs

Prox es un marco de trabajo libre de entrenamiento que permite la ejecución eficiente de FFN SwiGLU dispersos en LLMs mediante la construcción de máscaras de canales a partir de la saliencia aproximada de los canales intermedios, logrando así aceleraciones significativas y una calidad de modelo superior en comparación con los métodos existentes sin requerir reentrenamiento.

Autores originales: Jinyi Liu, Wei Chen, Pengyu Chen, Xinyi Yuan, Minghe Bai, Guoquan Wu, Jun Wei

Publicado 2026-07-31
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Jinyi Liu, Wei Chen, Pengyu Chen, Xinyi Yuan, Minghe Bai, Guoquan Wu, Jun Wei

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando ejecutar un cerebro robótico masivo e hiperinteligente en un dispositivo pequeño y alimentado por batería. Este cerebro, conocido como Modelo de Lenguaje Extenso (LLM), es increíble para escribir historias, resolver problemas matemáticos y charlar, pero también es increíblemente hambriento. Devora memoria y potencia de procesamiento solo para pensar en la siguiente palabra de una oración. Para hacer que estos robots sean más rápidos y menos sedientos, los científicos han estado tratando de enseñarles a "saltarse" partes de su proceso de pensamiento que no son importantes. Esto se llama dispersión de activación (activation sparsity). Piensa en esto como un chef que, en lugar de picar cada verdura en la cocina para una sopa, prueba rápidamente los ingredientes y solo pica los que realmente añadirán sabor, dejando el resto intacto. El objetivo es obtener la misma sopa deliciosa (la respuesta correcta) pero con mucho menos trabajo. Sin embargo, la parte difícil es averiguar qué verduras saltarse sin tirar accidentalmente la especia secreta que hace que el plato sepa bien. Si adivinas mal, la sopa queda insípida o, peor aún, incomestible.

Este es el rompecabezas que aborda un nuevo método llamado Prox, desarrollado por el investigador Jinyi Liu y su equipo. Se centraron en un tipo específico de arquitectura de cerebro robótico llamada SwiGLU, que es el estándar actual para muchos modelos potentes. Los investigadores descubrieron que, aunque el "pensamiento intermedio" del cerebro (un estado intermedio) contiene el mapa perfecto para decidir qué saltarse, calcular ese mapa exactamente es demasiado lento y costoso. Por ello, idearon un truco ingenioso de dos pasos. Primero, utilizan un "borrador" rápido y de baja calidad del pensamiento del cerebro para decidir rápidamente qué partes son importantes. Luego, y esto es la clave, solo realizan la matemática pesada y precisa en esas partes específicas e importantes, ignorando el resto por completo. Sus experimentos demostraron que este método es mucho mejor que otros trucos anteriores que intentaban adivinar la importancia sin realizar primero la matemática completa. En pruebas realizadas en diez modelos de IA diferentes, Prox aceleró el pensamiento del robot casi al doble (hasta 1.99 veces más rápido) manteniendo las respuestas tan inteligentes como la versión lenta y de velocidad completa. Es como tener un explorador súper rápido que corre por delante para marcar el camino, permitiendo que el ejército principal marche solo por los caminos pavimentados y seguros, ahorrando tiempo y energía sin perderse.

El Problema: El Almuerzo Pesado del Robot

Los Modelos de Lenguaje Extensos son como bibliotecas gigantes de conocimiento, pero también son muy pesados. Cuando intentan responder a una pregunta, tienen que mover una cantidad masiva de datos dentro de su memoria. Una gran parte de este tráfico proviene de una parte específica del cerebro llamada Red de Alimentación hacia Adelante (FFN). Puedes pensar en la FFN como la parte del cerebro que toma una idea, la procesa y la transmite. En los modelos modernos, esta parte utiliza una receta especial llamada SwiGLU, que involucra tres operaciones matemáticas (proyecciones) trabajando juntas.

El problema es que estas tres operaciones son tan pesadas que ralentizan todo. Los científicos han intentado solucionar esto haciendo que el modelo sea "disperso", lo que significa que intentan saltarse la matemática de las partes del cerebro que parecen poco importantes. Sin embargo, los métodos existentes para hacer esto sin reentrenar el modelo (lo cual toma una eternidad) tienen un fallo. A menudo adivinan qué partes saltarse basándose en solo una pieza de información, como mirar solo la "puerta" (gate) o solo la parte "ascendente" (up) de la receta. Esto es como intentar decidir si una canción es buena escuchando solamente la batería o solamente las voces. Si adivinas mal, te saltas una nota crucial, y la canción (o la respuesta de la IA) se desmorona. A medida que los investigadores intentaban saltarse más y más partes para ser más rápidos, la calidad de las respuestas caía significativamente.

La Intuición: El Mapa vs. El Viaje

Los investigadores, liderados por Jinyi Liu, notaron algo interesante sobre la receta SwiGLU. Hay un momento específico en el proceso llamado estado intermedio (llamémoslo "pensamiento intermedio"). Este pensamiento intermedio es la señal perfecta para decidir qué partes del cerebro mantener y cuáles saltarse. Si pudieras ver este pensamiento intermedio exactamente, podrías saltarte hasta el 70% del trabajo y aun así obtener una respuesta perfecta.

Pero aquí está el truco: para ver este pensamiento intermedio exactamente, tienes que hacer toda la matemática pesada primero. Es como intentar ver la línea de meta de una carrera, pero tienes que correr toda la carrera para llegar allí. Eso anula el propósito de intentar ahorrar tiempo.

El equipo se dio cuenta de que no necesitaban el valor exacto del pensamiento intermedio. Solo necesitaban conocer el orden de importancia. Necesitaban saber qué partes eran las "grandes" y cuáles eran las "pequeñas", no los números exactos. Esta es la diferencia entre saber exactamente cuántos dólares hay en tu billetera frente a simplemente saber qué billetes son los más grandes. Si puedes adivinar el orden correctamente, puedes elegir las cosas adecuadas para conservar.

La Solución: El Truco de Dos Etapas de Prox

Para resolver esto, el equipo creó Prox, un marco de trabajo de dos etapas que actúa como un explorador inteligente y un constructor preciso.

Etapa 1: El Explorador Rápido (Construcción del Proxy)
En la primera etapa, Prox utiliza una versión "barata" de la matemática. Toma la entrada y la pasa a través de una versión simplificada y de menor calidad del cerebro (usando pesos cuantizados, que son como números más pequeños y comprimidos). No intenta obtener la respuesta perfecta; solo quiere tener una idea aproximada de qué canales son fuertes y cuáles son débiles. Crea una "máscara", que es básicamente una lista de etiquetas de "Mantener" y "Descartar". Debido a que esta etapa utiliza matemática simplificada, es muy rápida y no requiere mucha memoria. Crucialmente, los errores en este cálculo aproximado no arruinan la respuesta final porque los números aproximados nunca se utilizan para la salida final; solo se usan para crear la lista.

Etapa 2: El Constructor Preciso (Cálculo Disperso Exacto)
Una vez hecha la lista, entra en juego la segunda etapa. Aquí es donde ocurre la verdadera magia. El modelo mira la lista de la Etapa 1 y dice: "Bien, vamos a ignorar el 70% del trabajo y solo haremos la matemática para el 30% superior". Pero aquí radica la diferencia con otros métodos: para ese 30% superior, Prox utiliza la matemática original, de alta precisión y de gran capacidad. Calcula los valores exactos para las partes importantes. Esto asegura que la respuesta final sea tan precisa como si el modelo hubiera hecho todo el trabajo, pero solo hizo el trabajo para las partes que importaban.

Por Qué Funciona Mejor

Los investigadores probaron Prox en diez modelos de lenguaje extenso diferentes, incluyendo modelos populares como Qwen, Mistral y Llama-3. Lo compararon con otros métodos que intentan saltarse el trabajo sin reentrenamiento.

Los resultados fueron claros: Prox fue el ganador. En niveles altos de dispersión (como un 70% de dispersión), otros métodos empezaron a cometer errores y las respuestas de la IA empeoraron. Prox, sin embargo, mantuvo las respuestas nítidas. De hecho, con un 70% de dispersión, Prox pudo acelerar el proceso de decodificación (la velocidad a la que la IA genera texto) hasta 1.99 veces en una tarjeta gráfica estándar. Eso significa que la IA podría hablar casi el doble de rápido sin perder su inteligencia.

El equipo también comprobó si este nuevo método se rompería si se intentaba combinar con otros trucos para acelerar, como hacer los números más pequeños (cuantización) o saltarse partes del mecanismo de atención. Descubrieron que Prox funciona perfectamente junto a estos otros métodos, como un adaptador universal que encaja en cualquier configuración.

La Conclusión

El artículo concluye que Prox es una forma poderosa y que no requiere reentrenamiento para hacer que la IA sea más rápida. Demuestra que no es necesario reentrenar un modelo gigante para hacerlo eficiente. En su lugar, puedes usar un proceso ingenioso de dos pasos: usa una suposición rápida y aproximada para encontrar las partes importantes, y luego realiza el trabajo pesado solo en esas partes. Este enfoque evita el "juego de adivinanzas" que causó que otros métodos fallaran, asegurando que el cerebro robótico se mantenga rápido e inteligente, incluso cuando se ejecuta en un dispositivo pequeño. Aunque la versión actual es mejor para conversaciones de un solo usuario (como chatear en un teléfono), los investigadores sugieren que, con algo más de trabajo, esta idea podría eventualmente ayudar a ejecutar grupos de usuarios aún más grandes de manera eficiente. Por ahora, representa un paso importante hacia la creación de una IA más rápida sin sacrificar su inteligencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →