← Últimos artículos
💬 NLP

dMoE: dLLMs with Learnable Block Experts

El artículo propone dMoE, un marco de Mezcla de Expertos a nivel de bloque para Modelos de Lenguaje de Difusión que agrega distribuciones de expertos a nivel de token para reducir significativamente el uso de memoria y la latencia de inferencia al minimizar los expertos activados de forma única, manteniendo al mismo tiempo un rendimiento competitivo.

Autores originales: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

Publicado 2026-06-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva y superinteligente (el Modelo de Lenguaje Grande de Difusión, o dLLM) que puede escribir historias, resolver problemas matemáticos y responder preguntas. Para hacer que esta biblioteca sea aún más inteligente sin que sea demasiado pesada de cargar, los arquitectos le añadieron una característica especial llamada Mezcla de Expertos (Mixture-of-Experts o MoE).

Piensa en los "Expertos" como un equipo de 100 bibliotecarios especializados. Cuando haces una pregunta, la biblioteca no les pide a los 100 expertos que trabajen en ella. En su lugar, hay un "Enrutador" (un gerente de bibliotecarios) que elige a los 8 expertos mejor capacitados para tu pregunta específica. Esto mantiene el trabajo rápido y eficiente.

El Problema: La "Caminata en Grupo" vs. La "Caminata Solitaria"

Aquí es donde empezó el problema.

  • La Forma Antigua (Modelos Autoregresivos): Imagina a un excursionista caminando solo montaña arriba, paso a paso. En cada paso, el excursionista le pregunta al gerente: "¿A quién debo llamar para que me ayude justo ahora?". El gerente elige 8 expertos, ellos ayudan, y luego el excursionista da el siguiente paso.
  • La Nueva Forma (dLLMs): Los nuevos dLLMs son como un grupo haciendo senderismo en un grupo compacto. No caminan uno por uno; se mueven en grandes bloques de 32 personas a la vez. Pueden mirar todo el camino que tienen por delante y corregir múltiples pasos simultáneamente. ¡Esto es mucho más rápido!

El Desajuste:
El problema es que el "Gerente" (el Enrutador) todavía actuaba como si estuviera tratando con un excursionista solitario. Aunque el grupo se movía en un bloque, el gerente trataba a cada una de las 32 personas como si fueran un excursionista separado y solitario.

  • La Persona 1 del bloque pide ayuda: El gerente elige 8 expertos.
  • La Persona 2 pide: El gerente elige otros 8 expertos diferentes.
  • ...
  • La Persona 32 pide: El gerente elige otros 8 expertos más.

Debido a que el grupo se mueve junto, el gerente termina llamando a docenas de expertos diferentes solo para manejar un solo bloque de movimiento. Esto es como un conductor de autobús deteniéndose en 32 gasolineras diferentes para llenar el tanque de 32 autos distintos, aunque todos van en el mismo autobús. El autobús se queda atascado, la memoria (el combustible) se agota y todo el proceso se ralentiza porque el sistema está intentando cargar demasiados expertos diferentes a la vez.

La Solución: dMoE (El "Gerente de Bloque")

Los autores de este artículo proponen un nuevo sistema llamado dMoE. Se dieron cuenta de que, dado que el grupo se mueve unido, deben ser tratados como una unidad única al elegir a los expertos.

Así es como funciona dMoE, usando una analogía simple:

  1. La Votación del Grupo: En lugar de preguntar a cada una de las 32 personas del bloque individualmente quién necesita, dMoE le pide a todo el grupo que vote unido. "Oigan, bloque, ¿qué tipo de ayuda necesitan colectivamente?".
  2. La Lista Unificada: El gerente toma todos los votos individuales y los combina en una "Puntuación de Bloque". Si 20 personas en el bloque necesitan al "Experto en Matemáticas E1" y 10 necesitan al "Experto en Matemáticas E2", el gerente ve que el bloque entero realmente necesita a E1 y E2.
  3. La Lista Corta Inteligente: El gerente luego mira esta lista combinada y dice: "Bien, para este bloque completo, realmente solo necesitamos a los mejores expertos que cubran el 90% de las necesidades del grupo". Crean una lista pequeña y fija de expertos (un "coreset") para todo el bloque.
  4. El Resultado: Ahora, en lugar de cargar con más de 60 expertos diferentes para un solo bloque, el sistema solo carga alrededor de 14. Es como si el conductor del autobús se diera cuenta de que "todos en este autobús necesitan gasolina de las mismas 3 estaciones", por lo que solo se detiene en esas.

Por qué esto importa (Los Resultados)

El artículo probó este nuevo "Gerente de Bloque" en un modelo de vanguardia llamado LLaDA2.0-mini utilizando pruebas difíciles de matemáticas y lógica (como MATH500 y GSM8K).

  • Menos Memoria: Debido a que no están cargando una lista enorme y caótica de expertos, el uso de memoria de la computadora disminuyó aproximadamente un 77% a 80%. Es como cambiar un camión que transporta 100 herramientas diferentes por una mochila que lleva solo las 14 esenciales.
  • Mayor Velocidad: El modelo corrió de 1.14x a 1.66x más rápido. El autobús no tuvo que detenerse en tantas gasolineras.
  • Sin Pérdida de Inteligencia: ¿La parte más impresionante? El modelo no se volvió más tonto. Mantuvo el 99.11% de su inteligencia original. Resolvió el mismo número de problemas matemáticos correctamente, solo que de manera mucho más eficiente.

En Resumen

El artículo dice: "Descubrimos que cuando estos nuevos modelos de IA trabajan en grupos, tratarlos como individuos causa un embotellamiento. Al permitir que el grupo vote junto sobre a quién necesita, podemos reducir el número de trabajadores que llamamos en casi 5 veces, ahorrar una gran cantidad de memoria y hacer que la IA funcione más rápido, todo sin perder su capacidad intelectual".

Esta es una estrategia "aprendible", lo que significa que la IA aprende cómo agrupar estos votos durante su entrenamiento, convirtiéndolo en una solución inteligente y automática.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →