← Últimos artículos
💻 computer science

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

El artículo introduce Mixture of Training (MoT), un marco de preentrenamiento modular con andamiaje que particiona un Transformer en bloques de capas entrenables de forma independiente que pueden recomponerse en un modelo coherente, demostrando que tales ejecuciones descompuestas pueden alcanzar la paridad de calidad con el entrenamiento monolítico mientras ofrecen ventajas potenciales de cómputo a través de andamios reutilizables.

Autores originales: Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

Publicado 2026-08-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir un castillo masivo e intrincado con piezas de LEGO. Normalmente, la única forma de hacer esto es tener un solo equipo gigante de constructores trabajando juntos en toda la estructura a la vez. Si una persona deja caer un ladrillo, todo el equipo tiene que detenerse, y si el equipo se vuelve demasiado grande, la habitación se llena y el proyecto se vuelve increíblemente costoso y lento de reparar. Así es como los científicos suelen construir los "Modelos de Lenguaje Extensos" (LLM), esos cerebros informáticos súper inteligentes que pueden escribir historias, responder preguntas y charlar con nosotros. Se entrenan como un bloque gigante e inquebrantable. Pero, ¿qué pasaría si pudieras construir el castillo en habitaciones separadas y más pequeñas, dejar que diferentes equipos trabajen en cada habitación de forma independiente y luego ensamblarlos todos al final? Esa es la gran pregunta que plantea este artículo: ¿Podemos descomponer el entrenamiento de una IA inteligente en piezas más pequeñas y manejables que puedan reensamblarse después sin perder la magia?

Los investigadores detrás de este estudio, trabajando en un proyecto llamado "Mezcla de Entrenamiento" (o MoT, por sus siglas en inglés), decidieron probar esta idea. No solo supusieron; construyeron un modelo de IA de 1.3 mil millones de parámetros (un modelo "estilo Gemma") e intentaron entrenarlo en rebanadas. En lugar de entrenar todo de una vez, dividieron el modelo en dos grandes fragmentos. Para asegurarse de que estos fragmentos encajaran después, utilizaron un truco ingenioso: un "andamio". Imagina un conjunto de rueditas de entrenamiento o un marco rígido que sujeta las piezas en su lugar mientras se construyen. Congelaron este marco (llamado "alineador") para que no cambiara, y luego entrenaron cada fragmento de la IA dentro de este marco. De esta manera, cada fragmento aprendió a hablar el mismo "lenguaje" de datos, aunque fueran entrenados por separado.

Los resultados fueron una mezcla de "¡funciona!" y "depende". El equipo descubrió que, de hecho, podían tomar estos fragmentos entrenados de forma independiente, ensamblarlos y obtener una IA funcional. Sin embargo, en el momento en que los ensamblaron, la IA se confundió un poco y cometió más errores (una puntuación de "perplejidad" más alta de 19.3 en comparación con el 15.0 estándar). Pero aquí está la parte genial: después de una breve sesión de "ajuste" donde dejaron que todo el modelo hablara consigo mismo por un momento, la IA se volvió tan buena como el método tradicional del bloque gigante. De hecho, encontraron una forma de entrenarla que utilizaba la misma cantidad de potencia de cómputo y alcanzaba exactamente la misma calidad que el método estándar.

Pero hay un inconveniente. El artículo sugiere que este método no es una varita mágica que ahorra dinero instantáneamente para todo el mundo. El propio "andamio" cuesta mucha energía de construir primero. Si solo construyes una IA, el andamio hace que todo el proceso sea más costoso que la forma antigua. Sin embargo, si reutilizas ese mismo andamio para construir muchas IAs diferentes (como construir tres o más castillos usando el mismo juego de rueditas de entrenamiento), el costo por castillo disminuye y el método se convierte en un ganador. Los investigadores también descubrieron que si intentas dividir la IA en demasiadas piezas diminutas, se vuelve más difícil encajarlas y la calidad cae. Así que, aunque esto no es un reemplazo para el método de entrenamiento gigante de "todo en uno" todavía, demuestra que descomponer el entrenamiento de la IA en trabajos más pequeños, reutilizables y paralelos es posible. Abre una nueva forma de experimentar con la IA, haciendo que sea más fácil corregir errores, reiniciar partes del trabajo y potencialmente entrenar modelos más inteligentes en el futuro sin necesidad de una supercomputadora del tamaño de una ciudad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →