← Últimos artículos
💻 computer science

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

El artículo presenta a Aryabhata 2, un modelo de lenguaje entrenado mediante aprendizaje por refuerzo basado en GPT-OSS-20B que logra un rendimiento superior y una mayor eficiencia de tokens en exámenes competitivos de STEM como JEE y NEET, aprovechando un currículo de alta calidad y una exploración mediante implementación progresiva.

Autores originales: Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

Publicado 2026-05-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un estudiante brillante pero ligeramente disperso llamado GPT-OSS-20B. Este estudiante ha leído una biblioteca masiva de libros y conoce muchos hechos, pero cuando le pides que resuelva un problema complicado de matemáticas o ciencias con múltiples pasos (como los que se encuentran en los exámenes de acceso a la universidad más difíciles de la India), a veces divaga, se confunde o tarda una eternidad en escribir la respuesta. Podría obtener la respuesta correcta, pero utiliza mucha "tinta" (tokens informáticos) para hacerlo, lo cual es costoso y lento.

Los autores de este artículo querían convertir a este estudiante en un campeón en la resolución de problemas sin comprar un cerebro más grande (un modelo más grande). Crearon un nuevo estudiante llamado Aryabhata 2.

Así es como lo hicieron, explicado mediante analogías sencillas:

1. El Campo de Entrenamiento: Un Entrenador Estricto

En lugar de simplemente dejar que el estudiante lea más libros (que es lo que hace el entrenamiento estándar), los investigadores actuaron como un entrenador estricto utilizando Aprendizaje por Refuerzo.

  • El Sistema de Recompensas: Imagina un videojuego donde solo obtienes puntos si resuelves un acertijo correctamente Y lo explicas claramente. Si el estudiante obtiene la respuesta incorrecta, recibe cero puntos. Si obtiene la respuesta correcta pero escribe un ensayo de 10 páginas cuando una explicación de un párrafo sería suficiente, recibe una puntuación más baja.
  • El "Juez": El entrenador no solo confiaba en la palabra del estudiante. Utilizaron un "Juez" superinteligente (otra IA) para verificar cada paso. Si las matemáticas no cuadraban o la lógica era defectuosa, la respuesta se rechazaba inmediatamente.

2. El Plan de Estudios: De Fácil a Imposible

Los investigadores no lanzaron al estudiante a la parte profunda de inmediato. Construyeron un campo de entrenamiento de tres niveles:

  • Nivel 1 (Formato): Primero, enseñaron al estudiante cómo sostener correctamente el bolígrafo. Se centraron en asegurarse de que la respuesta se viera ordenada y siguiera una estructura específica.
  • Nivel 2 (El Esfuerzo): Luego, dieron al estudiante miles de problemas de práctica. A medida que el estudiante mejoraba, el entrenador hacía los problemas más difíciles. Si el estudiante seguía acertando el 70%, el entrenador sustituía las preguntas por otras aún más complicadas.
  • Nivel 3 (La Comodín): Finalmente, permitieron que el estudiante intentara muchas formas diferentes de resolver el mismo problema difícil a la vez. Imagina pedirle al estudiante que intente 128 caminos diferentes para resolver un laberinto simultáneamente. Esto les ayudó a descubrir atajos inteligentes que no habían visto antes.

3. El Secreto: "Exploración Ampliada"

Por lo general, al entrenar una IA, podrías pedirle que resuelva un problema una sola vez. Aryabhata 2 fue entrenado para generar muchos intentos diferentes para cada pregunta.

  • La Analogía: Piensa en un detective resolviendo un crimen. En lugar de seguir una sola pista, el detective envía a 128 equipos diferentes a buscar pistas. Si incluso un equipo encuentra la pista correcta, el caso está resuelto. Este método ayudó al modelo a encontrar el "camino dorado" hacia la respuesta mucho más rápido y de manera más fiable.

4. Los Resultados: Más Rápido, Más Inteligente y Más Ligero

Cuando probaron a Aryabhata 2 en exámenes reales (como JEE y NEET) e incluso en competiciones de matemáticas superdifíciles (como AIME), los resultados fueron impresionantes:

  • Mejor Precisión: Resolvió más problemas correctamente que su modelo "padre" (GPT-OSS-20B) e incluso superó a algunos modelos mucho más grandes y costosos.
  • El Ahorro de "Tokens": Esta es la mayor victoria. El modelo original a menudo escribía explicaciones largas y tortuosas. Aryabhata 2 aprendió a ser conciso. Utilizó hasta un 64% menos de palabras (tokens) para obtener el mismo resultado (o mejor).
    • Analogía: Si el modelo antiguo era como un turista que toma 100 fotos para encontrar la toma perfecta, Aryabhata 2 es como un fotógrafo profesional que captura la toma perfecta en un solo clic.

La Conclusión

El artículo afirma que, al utilizar un conjunto muy específico y de alta calidad de preguntas de práctica y un método de entrenamiento inteligente y multifase, convirtieron una IA estándar de 20 mil millones de parámetros en un experto especializado en razonamiento STEM. No necesitaba ser un modelo gigante para ser inteligente; solo necesitaba el tipo correcto de práctica y un entrenador que supiera exactamente cómo recompensar el buen comportamiento.

Lo que no afirmaron:
El artículo no afirma que esta IA pueda reemplazar a los profesores humanos, diagnosticar condiciones médicas o utilizarse para conversaciones generales. Está construida específicamente para resolver problemas de ciencias, matemáticas e ingeniería encontrados en exámenes competitivos, actuando como un tutor altamente eficiente para esas materias específicas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →