Mellum2 Technical Report
Mellum 2 es un modelo de lenguaje de pesos abiertos, de 12B de parámetros y de tipo Mezcla de Expertos (Mixture-of-Experts), con 2.5B de parámetros activos por token, especializado en ingeniería de software y tareas agénticas, el cual logra un rendimiento competitivo con modelos más grandes a través de innovaciones arquitectónicas como la Predicción de Multi-Token y un currículo de entrenamiento de tres fases que abarca 10.6 billones de tokens.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando construir un asistente de programación súper inteligente que viva dentro de tu computadora. El desafío es que quieres que sea increíblemente inteligente (como un ingeniero sénior) pero también increíblemente rápido y barato de ejecutar (como una laptop de oficina estándar). Usualmente, tienes que elegir uno: o la versión "inteligente" es enorme y lenta, o la versión "rápida" es demasiado simple para manejar problemas difíciles.
El equipo de JetBrains construyó Mellum 2 para resolver exactamente este problema. Así es como lo hicieron, explicado de forma sencilla:
1. El cerebro de "Navaja Suiza" (La Arquitectura)
La mayoría de los modelos de IA son como una única y gigante célula cerebral que lo hace todo. Mellum 2 es diferente. Está construido como una Mezcla de Expertos (MoE).
- La Analogía: Imagina una biblioteca masiva con 64 bibliotecarios especializados diferentes. Cuando haces una pregunta, el modelo no despierta a los 64 bibliotecarios. En su lugar, tiene un gerente inteligente que elige solo a los 8 bibliotecarios más relevantes para tu pregunta específica.
- El Resultado: El modelo tiene el conocimiento total de un cerebro "gigante" de 12 mil millones de parámetros, pero para cada palabra que escribe, solo "piensa" con el poder de un cerebro de 2.5 mil millones de parámetros. Esto lo hace lo suficientemente rápido para ejecutarse en hardware estándar mientras sigue siendo muy inteligente.
2. Los trucos de la "Ventana Deslizante" y el "Borrador"
Para hacerlo aún más rápido, añadieron dos atajos ingeniosos:
- Ventana Deslizante: En lugar de intentar recordar cada palabra que has escrito en una conversación (lo cual se vuelve lento), el modelo se enfoca en las últimas 1,024 palabras como una ventana deslizante en un tren. Mantiene el contexto más reciente nítido mientras deja que los detalles más antiguos se desvanezcan, lo que ahorra una tonelada de energía.
- El Asistente de "Borrador": El modelo tiene un pequeño asistente de "borrador" integrado. Antes de comprometerse a escribir una respuesta final, este pequeño asistente adivina las siguientes palabras. Si la suposición es correcta, el modelo principal se salta el trabajo y simplemente la acepta. Es como si un escritor tuviera a un amigo susurrándole la siguiente frase para que pueda escribir más rápido.
3. El "Currículo Escolar de Tres Fases"
No solo alimentaron al modelo con datos aleatorios. Lo enseñaron en tres etapas específicas, como un currículo escolar:
- Fase 1 (El Generalista): Comenzaron con una gran mezcla de datos generales de internet (70%) y algo de código (23%). Esto le dio al modelo una comprensión amplia de cómo hablan y escriben los humanos.
- Fase 2 (El Especialista): Cambiaron la mezcla para incluir más código de alta calidad (42%) y matemáticas. Aquí es donde el modelo comenzó a aprender las reglas específicas de la programación.
- Fase 3 (El Maestro): En la etapa final, la mezcla era casi enteramente de código y matemáticas (59% de código). Este es el "campo de entrenamiento" donde el modelo afiló sus habilidades para convertirse en un experto en codificación.
4. Dos Personalidades: "Instruct" y "Thinking"
A partir del mismo cerebro entrenado, lanzaron dos versiones del modelo:
- El Modelo "Instruct": Es el trabajador directo. Haces una pregunta y te da la respuesta inmediatamente. Es ideal para tareas rápidas.
- El Modelo "Thinking": Es el pensador profundo. Antes de darte una respuesta, escribe una "traza de razonamiento"—una explicación paso a paso de cómo resolvió el problema. Esto es como un estudiante que muestra su procedimiento en un examen de matemáticas. El documento encontró que este modo de "pensar" hace que el modelo sea mucho mejor para resolver acertijos lógicos difíciles y desafíos de codificación complejos.
5. La "Prueba" (Pruebas)
Probaron Mellum 2 contra otros modelos populares.
- Velocidad: Se ejecuta tan rápido como un modelo de 7 mil millones de parámetros (que es mucho más pequeño que su tamaño total de 12 mil millones) pero es más inteligente que muchos modelos de su tamaño.
- Codificación: Sobresale escribiendo código, depurando y usando herramientas (como buscar en la web o ejecutar comandos).
- El Intercambio: Debido a que se enfocaron tanto en convertirlo en un experto en codificación, es ligeramente menos conocedor de hechos generales del mundo (como historia o biología) en comparación con los modelos entrenados para ser chatbots generales. Sin embargo, para su trabajo previsto —ayudar a los desarrolladores— es un competidor de primer nivel.
Resumen
Mellum 2 es un asistente de codificación especializado que utiliza una arquitectura de "equipo de expertos" para ser inteligente y rápido. Fue entrenado a través de un currículo cuidadosamente diseñado para dominar el código y las matemáticas, y viene en dos sabores: uno para respuestas rápidas y otro para un razonamiento profundo y paso a paso. El equipo lo lanzó de forma gratuita para que cualquiera pueda usarlo para construir mejor software.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.