← Últimos artículos
🤖 machine learning

WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware

Este artículo presenta WiSP, un sistema de gestión de conjuntos de trabajo sensible al enrutamiento para modelos de Mezcla de Expertos en hardware de bajos recursos que pagina dinámicamente los pesos de los expertos y optimiza la asignación de VRAM entre los expertos y la caché KV para mejorar significativamente el rendimiento de decodificación sin modificar el motor de servicio subyacente.

Autores originales: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: La IA "demasiado grande para caber"

Imagina que tienes una biblioteca enorme de libros (el modelo de IA) que contiene cientos de miles de millones de páginas. Quieres leer una historia específica en un e-reader diminuto y portátil (una tarjeta gráfica estándar, o GPU).

El problema es que el e-reader no tiene suficiente memoria para contener toda la biblioteca a la vez. Sin embargo, para cualquier frase que leas, solo necesitas unas pocas páginas específicas de unos pocos libros concretos. El resto de la biblioteca permanece sin usarse.

Las soluciones actuales intentan resolver esto manteniendo toda la biblioteca en un almacén (la memoria principal de la computadora) y corriendo al almacén para buscar las páginas que necesitas cada vez que pasas de página. Esto es lento porque el viaje al almacén (transferencia de datos) toma mucho tiempo.

La solución de WiSP: El "Bibliotecario Inteligente"

Los autores crearon un sistema llamado WiSP (Paginación de Conjunto de Trabajo o Working-Set Paging). En lugar de correr al almacén por cada página, WiSP actúa como un bibliotecario inteligente que observa lo que estás leyendo y mantiene una pequeña pila curada de los libros que es probable que necesites justo en tu escritorio (la memoria de la GPU).

Así es como funciona en tres partes simples:

1. La "Pila Inteligente" (Paginación de Expertos)

En los modelos de IA llamados "Mezcla de Expertos" (MoE, por sus siglas en inglés), el modelo tiene muchos "expertos" diferentes (submodelos especializados), pero solo utiliza unos pocos para cada palabra que genera.

  • La forma antigua: El sistema agarra todos los expertos para una capa, incluso si solo usa dos de ellos. Desperdicia espacio y tiempo.
  • La forma de WiSP: WiSP solo mantiene en tu escritorio los expertos específicos que realmente estás usando. Si necesitas un nuevo experto, intercambia rápidamente uno de la pila por el nuevo y lo toma del almacén.
  • El resultado: Debido a que solo mueve las piezas diminutas que realmente necesitas, es mucho más rápido. El artículo encontró que, en computadoras pequeñas, esto hace que la IA funcione hasta 2 veces más rápido que el método antiguo.

2. El "Escritorio Compartido" (Asignación de Memoria)

Tu escritorio (memoria de la GPU) es muy pequeño. Tienes dos cosas peleando por el espacio:

  1. La Pila de Expertos: Los libros que necesitas leer en este momento.
  2. Las Notas de Contexto (KV Cache): Las notas que has escrito sobre la historia hasta ahora, para que no olvides lo que pasó.

Si llenas tu escritorio con demasiados libros, no tendrás espacio para tus notas. Si lo llenas con demasiadas notas, no podrás agarrar los libros que necesitas.

  • La solución de WiSP (MV-WSA): Esta es una regla inteligente que decide cómo dividir el espacio de tu escritorio. Constantemente pregunta: "¿Es más útil tener más libros en el escritorio o más notas?".
  • Ajusta la división de forma dinámica. Si estás escribiendo una historia larga, te da más espacio para las notas. Si estás cambiando de tema rápidamente, te da más espacio para los libros. Esto asegura que nunca te quedes sin espacio para ninguno de los dos.

3. El Mito de la "Bola de Cristal" (Por qué la predicción no ayudó)

Los investigadores se preguntaron: "¿Qué pasa si usamos una bola de cristal (predicción de IA) para adivinar qué libro necesitarás después y lo agarramos antes de que lo pidas?".

  • La sorpresa: Descubrieron que en este escenario específico (leer una frase a la vez), la predicción no lo hace más rápido.
  • ¿Por qué? El "camino" (conexión de datos) entre el almacén y el escritorio es demasiado estrecho. Incluso si adivinas perfectamente, el camión solo puede transportar cierta cantidad a la vez. El cuello de botella no es adivinar el libro correcto; es la velocidad del camión.
  • El valor real: La "bola de cristal" sigue siendo útil, pero no para la velocidad. Ayuda al bibliotecario a saber exactamente qué tan grande debe ser la pila para ti específicamente. Esto permite al sistema reducir la pila al tamaño perfecto, liberando más espacio en el escritorio para tus notas.

La Conclusión

El artículo argumenta que ejecutar grandes modelos de IA en computadoras pequeñas es un problema de gestión de memoria, no solo un problema de computación.

  • WiSP es una herramienta que actúa como un bibliotecario inteligente, manteniendo solo los libros necesarios en el escritorio y cambiándolos de manera eficiente.
  • No cambia el modelo de IA en sí; solo gestiona la memoria mejor.
  • Hace que la IA funcione significativamente más rápido en dispositivos pequeños al evitar que pierda tiempo moviendo datos innecesarios.
  • Nos enseña que, en este escenario específico, gestionar tu espacio de trabajo de manera eficiente es más importante que intentar predecir el futuro.

El sistema funciona tan bien que puede incluso ejecutar modelos de IA masivos en una sola tarjeta de computadora que antes no podía manejarlos en absoluto, sin cambiar la calidad de las respuestas que da la IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →