← Últimos artículos
🤖 machine learning

SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs

SHAPE es un marco de poda de expertos impulsado por tareas para LLMs de Mezcla de Expertos Dispersos que modela la cooperación intra-capa de los expertos como un juego cooperativo para identificar y retener subconjuntos colaborativos esenciales mediante atribución de estilo Shapley, reduciendo así la huella de memoria mientras mantiene la precisión sin entrenamiento adicional.

Autores originales: Yuhao Zhang

Publicado 2026-06-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuhao Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una cocina masiva y de alta potencia (un Modelo de Lenguaje Extenso) diseñada para preparar respuestas complejas. En lugar de tener un solo chef gigante que lo haga todo, esta cocina utiliza un sistema de Mezcla de Expertos (MoE). Piensa en esto como un equipo de 100 subchefs especializados (los "expertos").

Cuando un cliente pide un plato (un prompt), un jefe de sala (el "enrutador") observa el pedido y elige a los 3 mejores chefs para trabajar en él juntos. La magia es que la cocina no necesita que los 100 chefs estén activos al mismo tiempo; solo usa los 3 específicos necesarios para ese momento. Esto hace que la cocina sea muy rápida y eficiente.

El Problema: El "Muro de la Memoria"
Aunque solo hay 3 chefs cocinando en cualquier segundo dado, el dueño de la cocina tiene que mantener a los 100 chefs presentes en la sala, completamente vestidos y listos para actuar. ¿Por qué? Porque el camarero podría necesitar a cualquiera de ellos para el siguiente pedido.

  • El Problema: Si tienes una cocina de 100 chefs, necesitas una sala enorme y costosa (memoria de GPU) para que quepan todos. Esto hace que sea imposible ejecutar estas cocinas tan potentes en espacios más pequeños y económicos (como una sola laptop o un servidor pequeño).
  • La Solución Antigua: Los intentos previos para encoger la cocina fueron como un gerente diciendo: "Despidamos a los chefs que no han cocinado mucho esta semana". Esto es defectuoso porque un chef puede no cocinar con frecuencia, pero cuando lo hace junto con un compañero específico, crean una obra maestra. Despedirlos rompe ese trabajo en equipo especial.

La Solución: SHAPE (El Detective del Trabajo en Equipo)
El artículo presenta SHAPE, una nueva forma de encoger la cocina sin arruinar la comida. En lugar de simplemente contar con qué frecuencia se llama a un chef, SHAPE observa qué tan bien trabajan juntos.

Así es como funciona SHAPE, usando una analogia simple:

  1. La Observación del "Juego": SHAPE observa la cocina durante un corto periodo de tiempo (usando un pequeño "conjunto de calibración" de pedidos). No solo observa quién es llamado; observa qué grupos de 3 chefs son llamados juntos y con qué frecuencia esos grupos tienen éxito.
  2. La Puntuación "Shapley" (Equidad): Imagina que un grupo de 3 chefs crea un plato perfecto. ¿Cuánto crédito recibe cada chef?
    • Si el Chef A es genial por sí solo, pero el Chef B es inútil sin el Chef C, un conteo simple podría pasarlo por alto.
    • SHAPE utiliza un concepto matemático llamado Valor de Shapley (piensa en esto como un "calculador de equidad"). Pregunta: "Si eliminamos al Chef A de este trío específico, ¿el plato se desmorona?".
    • Si el plato se desmorona, el Chef A es esencial para ese equipo, incluso si no es el chef más famoso.
    • Si el plato sabe igual sin el Chef A, entonces el Chef A es redundante y puede ser despedido.
  3. La Regla de "Cobertura de Calidad": SHAPE no se limita a despedir al 20% inferior de los chefs basándose en una sola puntuación. Asegura que cada "piso" de la cocina (cada capa del modelo) mantenga suficientes chefs para cubrir las combinaciones de trabajo en equipo más importantes. Utiliza un método de "bisección" (un juego de adivinación inteligente) para encontrar el número perfecto de chefs para mantener, de modo que la cocina se mantenga pequeña pero cocine el 99% de los mismos platos perfectamente.

Los Resultados
Los investigadores probaron esto en tres "cocinas" modernas diferentes (Qwen, GPT-OSS, DeepSeek).

  • El Resultado: Fueron capaces de despedir al 20% al 40% de los chefs (reduciendo significamente la memoria necesaria) sin que la comida supiera peor.
  • Por qué funcionó: Al mantener a los chefs que son esenciales para el trabajo en equipo en lugar de solo a los que están ocupados, la cocina se mantuvo estable.
  • El Bonus: Debido a que despidieron a tantos chefs, la sala (memoria de GPU) necesaria para ejecutar la cocina se volvió mucho más pequeña, haciendo posible ejecutar estos modelos tan potentes en hardware menos costoso.

En Resumen
SHAPE es como un gerente inteligente que se da cuenta de que despedir al chef "silencioso" que es el pegamento secreto de un equipo ganador es una mala idea. En su lugar, despide a los chefs "ruidosos" que son fácilmente reemplazables. Esto reduce el tamaño del equipo y el espacio de oficina necesario, manteniendo la calidad del trabajo exactamente igual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →