← Últimos artículos
💬 NLP

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

Nemotron-Cascade 2 es un modelo MoE de 30B parámetros (con 3B activados) que, gracias a su entrenamiento con RL en cascada y destilación en línea multi-dominio, alcanza un rendimiento de nivel olímpico en matemáticas, programación y capacidades agénticas, superando a modelos mucho más grandes con una densidad de inteligencia 20 veces mayor.

Autores originales: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi
Publicado 2026-03-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que acabamos de presentar a un nuevo genio en el mundo de la Inteligencia Artificial. Se llama Nemotron-Cascade 2.

Para explicarte de qué va este papel sin usar palabras técnicas aburridas, vamos a usar una analogía de una escuela de entrenamiento para atletas olímpicos.

1. ¿Quién es este "atleta"?

Imagina un atleta llamado Nemotron.

  • Su tamaño: Es sorprendentemente pequeño. Mientras que otros atletas de élite (como los modelos de IA más grandes) son como gigantes de 600 o 700 kilos, Nemotron pesa solo 30 kilos (30 mil millones de parámetros). Pero, ¡ojo! Solo usa 3 kilos de su fuerza en cada momento (3 mil millones de parámetros activos). Es como un velocista que, aunque es pequeño, corre más rápido que los culturistas gigantes.
  • Su logro: A pesar de ser "pequeño", ha ganado medallas de oro en las olimpiadas más difíciles del mundo: la Olimpiada Internacional de Matemáticas (IMO) y la Olimpiada de Informática (IOI). ¡Ha superado a gigantes que pesan 20 veces más que él!

2. ¿Cómo entrenó? (La Magia del "Cascade RL")

Antes, entrenar a una IA para que sea buena en todo era como intentar enseñarle a un niño a ser un cirujano, un pianista y un piloto de carreras al mismo tiempo, todos los días. Al final, el niño se confundía y olvidaba cómo ser cirujano cuando practicaba piano.

Nemotron-Cascade 2 usó un nuevo método de entrenamiento llamado Entrenamiento en Cascada. Imagina que es como un plan de estudios escalonado:

  1. Fase 1: Aprender a seguir reglas (IF-RL). Primero, le enseñaron a obedecer instrucciones estrictas. "Si te digo que escribas 5 palabras, escribe exactamente 5".
  2. Fase 2: Especialización por materias (Multi-domain RL). Luego, le dieron clases intensivas de matemáticas. Cuando terminó, pasó a clases intensivas de programación. Luego a ciencias.
    • El truco: Al entrenar en una sola materia a la vez, no se olvida de las anteriores. Es como si un estudiante se graduara en matemáticas antes de entrar a la facultad de medicina, en lugar de estudiar ambas a la vez y mezclar los conceptos.
  3. Fase 3: El "Profesor Fantasma" (Distilación On-Policy). Aquí viene lo más genial. Durante el entrenamiento, a veces la IA se confundía y bajaba su rendimiento en matemáticas porque estaba aprendiendo programación.
    • Para arreglarlo, el sistema creó "profesores intermedios". Imagina que en cada etapa del entrenamiento, guardan la versión más inteligente de la IA en esa materia específica. Luego, usan a esos "profesores" para enseñarle a la IA actual cómo no olvidar lo que ya sabía. Es como si un alumno revisara sus apuntes de la semana pasada mientras estudia la nueva lección para no perder el hilo.

3. ¿Qué sabe hacer?

Gracias a este entrenamiento, Nemotron-Cascade 2 es increíblemente versátil:

  • Matemáticas: Resuelve problemas de nivel olímpico que dejan perplejos a los humanos.
  • Programación: Escribe código complejo y soluciona errores como un ingeniero de software experto.
  • Agentes: No solo responde preguntas; puede "pensar" y usar herramientas. Imagina que le pides que reserve un vuelo, compare precios y te haga un itinerario; él puede hacerlo solo, usando su "brazo" digital para navegar por internet y usar calculadoras.
  • Contexto Largo: Puede leer un libro entero de 1 millón de palabras y recordarte un detalle específico de la página 50.

4. ¿Por qué es importante?

Hasta ahora, para tener una IA que ganara medallas de oro en matemáticas, necesitabas un "gigante" computacional que costaba millones de dólares y consumía mucha energía.

Nemotron-Cascade 2 demuestra que la inteligencia no depende solo del tamaño. Con el entrenamiento correcto (la "Cascada" y la "Distilación"), un modelo pequeño y eficiente puede hacer lo mismo que los gigantes, pero de forma más rápida, barata y accesible.

En resumen:
Han creado un atleta olímpico de la IA que es pequeño, eficiente y ha aprendido a ser el mejor en matemáticas y programación mediante un entrenamiento inteligente, paso a paso, sin olvidar nada de lo que aprendió antes. Y lo mejor: ¡han abierto sus libros de texto y sus pesos para que cualquiera pueda estudiar cómo lo hicieron!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →