← Últimos artículos
🤖 machine learning

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

Este artículo revela que los modelos preentrenados existentes de Mezcla de Expertos (MoE) poseen inherentemente una sustancial dispersión de activación intra-experto, la cual puede aprovecharse modificando el pipeline de ejecución de vLLM para omitir los cálculos de neuronas inactivas, logrando una aceleración de hasta 2.5x en la ejecución de la capa MoE y una aceleración de 1.2x de extremo a extremo sin ninguna reentrenamiento del modelo o modificación de parámetros.

Autores originales: Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

Publicado 2026-05-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Encontrar a los "Gigantes Durmientes" en la IA

Imagina una cocina de restaurante de lujo masiva (el modelo de IA) que tiene cientos de chefs especializados (llamados Expertos). En una configuración estándar de "Mezcla de Expertos" (MoE), cuando un cliente pide un plato, el chef principal (el Enrutador) selecciona solo a unos pocos expertos específicos para trabajar en ese pedido. Por ejemplo, si el pedido es "curry picante", el enrutador podría despertar al "Experto en Especias" y al "Experto en Curry", mientras que el "Experto en Postres" y el "Experto en Pan" permanecen dormidos.

Esto ya es eficiente porque la cocina no activa a los 100 chefs para cada pedido individual. Sin embargo, los investigadores de este artículo se plantearon una nueva pregunta: "Incluso cuando un chef está despierto y trabajando, ¿está utilizando toda su energía?"

Descubrieron que incluso los chefs "despiertos" pasan la mayor parte del tiempo simplemente de pie sin hacer nada. Encontraron que dentro de un solo experto, hasta el 90% de las neuronas (las células cerebrales individuales de la IA) están efectivamente "dormidas" o produciendo una salida cero para una entrada dada.

El Problema: Por Qué No Podemos Simplement Añadir Más Chefs

Anteriormente, para hacer la IA más rápida, los investigadores intentaron hacer la cocina más eficiente añadiendo más chefs y despertando a menos de ellos (aumentando la "dispersión inter-experto"). Pero esto se está volviendo muy difícil.

  • La Lucha del Entrenamiento: Si tienes demasiados chefs y solo despiertas a unos pocos, la cocina se vuelve caótica. Algunos chefs reciben todo el trabajo (desequilibrio de carga), mientras que otros nunca reciben entrenamiento y se vuelven inútiles (colapso del experto).
  • El Límite: Estamos golpeando un muro donde no podemos hacer fácilmente que la selección de "quién recibe el trabajo" sea más eficiente sin romper el modelo.

La Solución: La Estrategia del "Chef Perezoso"

En lugar de intentar seleccionar menos chefs, los autores decidieron hacer que los chef individuales fueran más eficientes. Se dieron cuenta de que incluso cuando un chef está trabajando, no necesita usar cada herramienta de su caja de herramientas.

La Analogía:
Imagina a un maestro carpintero (un Experto) construyendo una silla.

  • Antiguo Método: El carpintero toma cada martillo, sierra y destornillador individual del cobertizo, incluso si solo necesita un martillo y un destornillador. Lleva todo el cobertizo al lugar de trabajo.
  • Nuevo Método (Este Artículo): El carpintero mira el trabajo, se da cuenta de que solo necesita el martillo y el destornillador, y deja la sierra y el otro 90% de las herramientas en el cobertizo. Solo lleva lo que necesita.

Los investigadores descubrieron que en los modelos de IA preentrenados existentes (como Qwen, Llama y DeepSeek), este comportamiento "perezoso" ya está ocurriendo naturalmente. Las matemáticas dentro del modelo anulan naturalmente la mayor parte del trabajo. Solo necesitaban enseñar a la computadora a omitir ese trabajo desperdiciado.

Cómo Lo Hicieron: El Sistema de "Lista de Omisión"

El equipo tomó un motor de IA de alta velocidad popular llamado vLLM (piensa en él como el servicio de entrega que lleva la comida desde la cocina hasta el cliente) y lo actualizó.

  1. La Verificación: Antes de que el "chef" comience a cocinar, el sistema verifica rápidamente qué herramientas (neuronas) son realmente necesarias.
  2. La Omisión: Si una herramienta no es necesaria (su valor es demasiado bajo), el sistema ni siquiera la carga en la memoria ni intenta usarla. Literalmente omite el cálculo.
  3. El Resultado: Construyeron un "carril rápido" especial en el software. Si el lote de pedidos es pequeño (como un almuerzo tranquilo), el sistema usa este carril rápido y omite el trabajo pesado. Si la cocina está súper ocupada (una gran hora punta de cena), cambia de nuevo al modo estándar y pesado para mantener la estabilidad.

Lo Que Encontraron (Los Resultados)

Probaron esto en ocho modelos de IA gigantes diferentes, que van desde modelos pequeños (1 mil millones de parámetros) hasta modelos masivos (400 mil millones de parámetros).

  • Precisión: Podían omitir hasta el 90% del trabajo dentro de un experto y la IA aún obtenía las respuestas correctas el 95% de las veces. Fue como omitir el 90% de los ingredientes en una receta y que el plato siguiera sabiendo un 95% tan bien.
  • Velocidad:
    • Para la parte específica de "cocinar" de la IA (la capa MoE), observaron aceleraciones de hasta 2.5 veces.
    • Para todo el sistema (de extremo a extremo), observaron una aceleración de 1.2 veces.
  • Hardware: La aceleración fue más dramática en tarjetas gráficas más pequeñas y menos potentes (como una tarjeta de juegos para consumidores), demostrando que esta es una excelente manera de ejecutar grandes modelos de IA en hardware más barato.

El Truco (Limitaciones)

El artículo es honesto sobre los límites:

  • El Portero: El sistema aún tiene que verificar qué herramientas son necesarias antes de poder omitirlas. Esta "verificación" toma tiempo y aún no se puede omitir. Es como si un gerente todavía tuviera que caminar por la cocina para decirle a los chefs qué herramientas agarrar, incluso si los chefs no usan todas ellas.
  • Tamaño del Lote: La aceleración es mejor cuando la IA procesa algunas solicitudes a la vez. Si estás procesando miles de solicitudes simultáneamente, la sobrecarga de "verificación" se convierte en un cuello de botella y la aceleración disminuye.

Resumen

Este artículo no inventó un nuevo tipo de IA ni entrenó un nuevo modelo desde cero. En cambio, miraron modelos de IA existentes y potentes y se dieron cuenta: "Oye, estos modelos ya están haciendo mucho trabajo innecesario, incluso cuando están 'activos'."

Al construir un sistema que reconoce este esfuerzo desperdiciado y simplemente lo omite, hicieron que estos masivos modelos de IA funcionaran significativamente más rápido y de manera más eficiente, especialmente en hardware que no es súper costoso. Es una técnica de "omisión inteligente" que hace que la generación actual de modelos de IA sea más práctica de ejecutar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →