← Últimos artículos
🤖 machine learning

Not only where, But when: Temporal Scheduling for RLVR

Este artículo introduce la "Programación Temporal" para el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR), un método que ajusta dinámicamente los criterios de asignación de crédito a lo largo del entrenamiento para priorizar comportamientos específicos de la política antes de transicionar a la optimización general, logrando así dinámicas de aprendizaje más estables y eficientes mientras se preserva la entropía de la política.

Autores originales: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

Publicado 2026-05-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrenando a un estudiante muy inteligente (la IA) para resolver problemas matemáticos complejos. En la antigua forma de hacerlo (llamada RLVR), le das al estudiante una sola calificación al final de su ensayo. Si obtiene una "A", le dices: "¡Buen trabajo!" y ellos intentan recordar cada palabra que escribieron para asegurarse de obtener una "A" nuevamente la próxima vez.

El problema es que el estudiante escribió miles de palabras. Algunas fueron momentos cruciales de "¡ajá!" donde comprendieron la lógica. Otras fueron simplemente palabras de relleno como "y luego", "por lo tanto" o "en conclusión". El antiguo método trata cada palabra como igualmente importante, lo cual es como darle al estudiante una estrella dorada por escribir "el" tanto como por resolver la ecuación real.

La antigua forma: Un foco estático

Investigadores anteriores intentaron solucionar esto usando un "foco". Construyeron herramientas para determinar qué palabras eran importantes (como los pasos lógicos) e iluminaron más intensamente esas palabras durante el entrenamiento. Esto se llama Asignación de Crédito.

Sin embargo, el artículo argumenta que hay un defecto en este enfoque: El foco nunca se mueve. Una vez que la herramienta decide que "la palabra #500 es importante", sigue iluminando la palabra #500 durante toda la duración del entrenamiento, desde el primer día hasta el último. Es como un entrenador que solo le grita al mariscal de campo, ignorando al resto del equipo, incluso cuando el mariscal de campo ya ha dominado su rol y necesita enfocarse en otra cosa. Este enfoque rígido eventualmente impide que el estudiante mejore más.

La nueva idea: Un cronograma dinámico (Programación Temporal)

Los autores proponen una nueva idea: No se trata solo de dónde iluminas, sino de cuándo.

Sugieren tratar el proceso de entrenamiento como un guion de película en lugar de una foto estática.

  • Al principio de la película (Entrenamiento): El estudiante apenas está comenzando. Necesita aprender a preparar la escena (el "andamiaje de razonamiento"). El artículo sugiere centrar el entrenamiento primero en la parte final de las respuestas del estudiante, porque esas son las partes más confiables (la respuesta final).
  • Más adelante en la película (Entrenamiento): Una vez que el estudiante es bueno para terminar la respuesta, desplazas lentamente el enfoque hacia atrás, hacia el principio del ensayo. Ahora entrenas al estudiante para construir mejores argumentos y lógica desde el inicio.

Esto se llama Programación Temporal. En lugar de un foco estático, tienes un director que cambia el enfoque de la cámara a medida que avanza la escena.

El truco de los "Percentiles de Trayectoria"

¿Cómo saben qué parte del ensayo deben enfocarse? Utilizan un truco simple llamado Percentiles de Trayectoria.

Imagina que la respuesta del estudiante es una pista de carreras de 100 metros.

  • El percentil 95 es la línea de meta (la respuesta final).
  • El percentil 50 es el medio de la carrera (el razonamiento).
  • El percentil 5 son los bloques de salida (la introducción).

El artículo descubrió que si comienzas entrenando al estudiante solo en las partes de "línea de meta" de sus respuestas, y luego expandes gradualmente el entrenamiento para incluir el "medio" y finalmente el "inicio", el estudiante aprende mucho más rápido y de manera más estable. Es como aprender a conducir: primero dominas el estacionamiento (el objetivo final), luego conduces por una carretera recta y finalmente navegas intersecciones complejas (el inicio del proceso de pensamiento).

¿Qué ocurrió en los experimentos?

Los investigadores probaron esto en grandes modelos de IA (como Qwen) utilizando acertijos matemáticos y de razonamiento.

  1. Mejores puntuaciones: Los modelos que utilizaron este método de "cronograma" obtuvieron puntuaciones más altas en pruebas de matemáticas (como AIME y HMMT) y pruebas de razonamiento general que los modelos estándar.
  2. Aprendizaje más saludable: Descubrieron que los antiguos métodos rígidos hacían que la IA "entrara en pánico" y perdiera su creatividad (llamada entropía). La IA se volvía demasiado rígida y dejaba de explorar nuevas formas de resolver problemas. El nuevo método de "cronograma" mantuvo el proceso de aprendizaje de la IA saludable y flexible, permitiéndole seguir mejorando sin quedarse atascada.
  3. Funciona con herramientas antiguas: Este nuevo método de programación funciona incluso si lo combinas con las antiguas herramientas de "foco". Es como añadir una nueva capa de entrenamiento sobre la existente.

La conclusión

El artículo afirma que para hacer a la IA más inteligente, no debemos decidir solo qué palabras entrenar; necesitamos decidir cuándo entrenarlas. Al comenzar con las partes más confiables de la respuesta y trabajar lentamente hacia atrás hasta las partes complejas de razonamiento, la IA aprende de manera más eficiente, mantiene su creatividad y logra mejores resultados. Convierte una sesión de entrenamiento rígida y de talla única en una sesión de entrenamiento dinámica y bien cronometrada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →