The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism
Esta encuesta técnica sintetiza la evolución de las arquitecturas de Mezcla de Expertos en los Modelos de Lenguaje de Gran Escala organizándolas en un grafo de dependencia y analizándolas a través de cuatro planos de control (Topología de Expertos, Enrutamiento, Equilibrio y Paralelismo de Expertos) para ilustrar el cambio del campo desde la simple activación de parámetros dispersos hacia el desacoplamiento del enrutamiento semántico, los presupuestos computacionales y la ejecución física.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el cerebro de una computadora superinteligente como una biblioteca enorme y bulliciosa. En los viejos tiempos, para responder una sola pregunta, la computadora enviaba a un bibliotecario a leer cada uno de los libros en los estantes, uno por uno, solo para estar seguros. Esto era lento y desperdiciaba mucha energía. Luego, los ingenieros inventaron una forma más inteligente: un "Mixture of Experts" (Mezcla de Expertos). En lugar de un solo bibliotecario leyendo todo, contrataron a miles de especialistas. Cuando llega una pregunta sobre cocina, solo el bibliotecario "Chef" abre su libro; cuando llega una pregunta sobre el espacio, solo el "Astrónomo" se despierta. Esta es la idea central de Mixture-of-Experts (MoE) en los Modelos de Lenguaje Extensos (LLMs): permite que los modelos de IA crezcan increíblemente grandes e inteligentes sin realizar cada uno de los cálculos para cada palabra que procesan.
Pero aquí está la parte difícil: si tienes un millón de especialistas, ¿cómo decides quién recibe el trabajo? Si envías todas las preguntas de "Espacio" al Astrónomo, este se verá abrumado y ralentizará todo, mientras que el "Chef" se quedará ocioso. Este es el problema de la "ruta" (routing). Es como intentar gestionar un concierto gigante donde tienes que decidir instantáneamente qué músico toca qué nota, asegurando que nadie se sienta abrumado, nadie esté aburrido y la música fluya perfectamente. Si te equivocas en la ruta, todo el sistema se detiene.
Este artículo, escrito por Jiguo Li en agosto de 2026, es una inmersión profunda en cómo estos sistemas de "expertos" han evolucionado con el tiempo. Sostiene que la historia de MoE no es solo una lista de modelos más nuevos y grandes lanzados año tras año. En cambio, es una historia de resolver un embotellamiento específico tras otro. El autor sugiere que el campo se ha movido a través de ocho "hitos" principales, pasando de simples trucos estadísticos a sistemas complejos y dinámicos donde la computadora puede decidir no solo quién ayuda, sino cuánta ayuda se necesita, e incluso dónde vive físicamente esa ayuda en el hardware de la computadora. El artículo encuentra que el futuro no es solo añadir más expertos, sino desenredar la lógica de "lo que la IA piensa" de la realidad física de "cómo funciona la computadora", permitiendo una IA más inteligente, rápida y eficiente que no se quede atrapada en el tráfico.
La historia de los ocho hitos
Piensa en la evolución de MoE como la historia del sistema de transporte público de una ciudad. Comenzó con un solo autobús que paraba en todas partes, luego pasó a un sistema donde podías llamar a un taxi y finalmente se convirtió en una red hipereficiente de drones y metros autoorganizados. El artículo divide este viaje en ocho fases distintas, o "hitos", donde cada paso resolvió un gran cuello de botella pero creó un nuevo desafío.
1. La división estadística del trabajo (El viejo autobús)
En los primeros días, la idea era simple: tener una "puerta" que decida qué "experto" (una pequeña parte del cerebro) debe manejar una tarea. Pero al principio, todos ayudaban un poco. Era como tener un autobús donde cada pasajero tenía que levantarse y saludar al conductor, incluso si no se bajaba. Era una división estadística del trabajo, pero no ahorraba energía. La computadora seguía haciendo todo el trabajo; solo lo hacía de una manera un poco más inteligente.
2. El interruptor "Top-K" (El servicio de taxi)
Luego llegó el gran avance: la Computación Condicional Dispersa (Sparse Conditional Computation). Imagina un interruptor que dice: "Solo los 2 mejores expertos pueden trabajar; los otros 98 pueden irse a casa". Esto es el enrutamiento Top-K. De repente, la computadora podía tener una biblioteca de conocimiento masiva (millones de parámetros) pero solo usar una pequeña fracción de ella para cada palabra. Esta fue la "palanca de capacidad": podías hacer el modelo más inteligente sin hacerlo más lento. Pero introdujo un nuevo problema: ¿qué pasa si el "Chef" recibe 1,000 pedidos y el "Astrónomo" ninguno? El sistema empezó a desequilibrarse.
3. El escalado de clústeres (La red de metro)
A medida que los modelos crecieron para caber en miles de chips de computadora (GPUs), el problema pasó a ser el movimiento de los datos. Si el "Chef" vive en el Chip A y el "Astrónomo" en el Chip B, ¿cómo llevas los ingredientes allí? Esta era introdujo el Paralelismo de Expertos y la comunicación All-to-All. Es como construir una enorme red de metro donde los tokens (las palabras) son los pasajeros y tienen que saltar a los trenes para llegar al experto correcto. El desafío pasó de "¿quién hace las matemáticas?" a "¿qué tan rápido podemos mover los datos sin que el tren se quede atascado?".
4. La era de los pesos abiertos (La aplicación de transporte público)
Luego, modelos como Mixtral demostraron que este sistema complejo podía funcionar para la gente común, no solo para laboratorios gigantes. Demostraron que podías tener un MoE de grano grueso (expertos grandes) que fuera abierto para que todos lo usaran. Pero los "expertos" seguían siendo demasiado grandes y torpes. Tendían a reaprender las mismas cosas básicas (como decir "hola"), lo cual era un desperdeto de espacio.
5. Expertos compartidos y de grano fino (Los quioscos especializados)
Para solucionar la torpeza, los ingenieros comenzaron a dividir los grandes expertos en muchos otros muy pequeños y de grano fino. Es como reemplazar una gran "Tienda General" por cientos de pequeños quioscos: uno para "comida picante", uno para "postres", uno para "opciones veganas". Esto permitió un enrutamiento mucho más preciso. También añadieron Expertos Compartidos (Shared Experts): un camino permanente para las cosas que todos necesitan (como la gramática básica), para que el sistema de enrutamiento no tuviera que perder tiempo decidiendo sobre lo básico. Esto hizo que el sistema fuera más rápido e inteligente, pero creó un nuevo atasco de tráfico: demasiados quioscos diminutos significaban demasiados viajes diminutos para el metro, ralentizando las cosas.
6. Escala ultra-dispersa (La biblioteca de un millón de expertos)
Después, los investigadores se preguntaron: "¿Qué pasa si tenemos muchísimos más expertos, pero aún más pequeños?". Modelos como Kimi K2 y PEER empezaron a utilizar cientos de expertos diminutos (¡a veces más de un millón!). La idea es tener un grupo de candidatos tan grande que la IA pueda encontrar al especialista perfecto para cada palabra. Pero el artículo señala una trampa: si tienes demasiados expertos, la computadora pasa más tiempo buscando a quién llamar (recuperación/retrieval) y moviendo datos que realizando el trabajo real. El "I/O de pesos" (cargar el cerebro del experto) se convirtió en el nuevo cuello de botella.
7. Cómputo Dinámico (El presupuesto flexible)
Hasta ahora, cada palabra recibía la misma cantidad de ayuda (por ejemplo, "Top-2" expertos). Pero algunas palabras son difíciles (como "física cuántica") y otras son fáciles (como "el"). El Cómputo Dinámico (Dynamic Compute) cambia las reglas: la IA puede decidir usar 1 experto para palabras fáciles y 4 para las difíciles. Algunos modelos incluso usan ranuras de "cero cómputo", donde la IA simplemente dice "ya sé esto, no hace falta llamar a nadie". Esto ahore energía, pero crea un nuevo riesgo: si aparecen muchas palabras difíciles al mismo tiempo, el sistema podría verse abrumado, causando retrasos (latencia de cola/tail latency).
8. Desacoplar la Lógica de la Física (La red de teletransporte)
La frontera final es el Enrutamiento Semántico Desacoplado de la Ejecución Física. Actualmente, si la IA decide llamar al "Astrónomo", los datos deben viajar físicamente al chip del Astrónomo inmediatamente. Las nuevas ideas (como ScMoE o Expertos Heterogéneos) sugieren que podemos separar la decisión del movimiento. Tal vez la IA decide usar al Astrónomo, pero los datos esperan en un búfer, o el Astrónomo tiene un tamaño diferente dependiendo de la tarea. Es como tener una red de teletransporte donde el destino se decide lógicamente, pero el transporte físico se optimiza por separado para evitar atascos de tráfico.
Los cuatro planos de control
El artículo organiza todos estos cambios en cuatro "planos de control", que son como los diferentes niveles de gestión en una gran empresa:
- La Capa de Objeto (Topología): Este es el "Organigrama". Define quiénes son los expertos, qué tan grandes son y si comparten un escritorio. Pregunta: "¿Tenemos 8 expertos grandes o 128 diminutos?".
- La Capa de Decisión (Enrutamiento): Este es el "Despachador". Para cada palabra, decide: "¿A quién llamo?". Utiliza una regla "Top-K" para elegir a los mejores especialistas.
- La Capa de Control (Equilibrio): Este es el "Gerente de RR.HH.". Vigila para asegurar que ningún experto trabaje las 24 horas del día mientras otros duermen. Si el "Chef" está sobrecargado, puede empujar suavemente al sistema para enviar algunos pedidos al "Panadero", usando trucos matemáticos especiales (como Auxiliary-Loss-Free) para hacer esto sin arruinar el aprendizaje de la IA.
- La Capa de Ejecución (Paralelismo de Expertos): Este es el "Equipo de Logística". Determina cómo mover realmente los datos a través de los chips físicos, gestionar el tráfico y asegurarse de que las matemáticas se realicen rápido.
Lo que el artículo descarta y lo que sugiere
El autor es muy claro sobre lo que no funciona como una solución mágica. Argumenta en contra de la idea de que existe una única estructura "perfecta" para todos los modelos MoE. Sugiere que simplemente añadir más expertos no es la respuesta si el sistema no puede mover los datos lo suficientemente rápido. También señala que el Soft MoE (donde los expertos se mezclan continuamente en lugar de elegir uno) no ha demostrado funcionar bien en los sistemas masivos y reales que usamos hoy, aunque suene bien en teoría.
El artículo sugiere que el futuro reside en el desacoplamiento. Necesitamos dejar de atar la "decisión inteligente" (qué experto usar) a la "realidad física" (en qué chip vive). Proponen que los mejores sistemas utilizarán presupuestos dinámicos (cambiando cuánto trabajo se realiza según la dificultad) y colocación en tiempo de ejecución (moviendo a los expertos mientras la computadora funciona para evitar el tráfico).
Sin embargo, el artículo tiene cuidado de no afirmar que estos son problemas "resueltos". Por ejemplo, aunque los Expertos Heterogéneos (expertos de diferentes tamaños) suenan genial, el artículo señala que todavía están en la etapa de "frontera de investigación" y no han sido probados completamente a la escala masiva de los modelos de billones de parámetros. Del mismo modo, el compartir entre capas (donde un experto de la capa 1 ayuda a la capa 100) es una idea interesante, pero el autor dice que necesitamos más evidencia para ver si realmente funciona sin causar confusión.
La conclusión fundamental
En términos simples, este artículo nos dice que el viaje para hacer la IA más inteligente no es solo construir un cerebro más grande. Es construir un mejor sistema de tráfico. Hemos pasado de un solo autobús a una compleja red de taxis, metros y drones. El siguiente paso no es solo añadir más vehículos; es hacer que los semáforos sean más inteligentes, las carreteras más flexibles y los despachadores capaces de manejar la hora punta sin colapsar. El autor concluye que la "próxima generación" de IA no será un único modelo nuevo, sino una combinación de estos trucos de enrutamiento inteligente, presupuestos dinámicos y optimizaciones físicas trabajando juntos. Es un recordatorio de que, en el mundo de las computadoras superinteligentes, a veces la parte más difícil no es pensar, sino llegar a su destino.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.