← Últimos artículos
🤖 machine learning

Rethinking the Divergence Regularization in LLM RL

Este artículo propone la Optimización de Política con Regularización de Divergencia (DRPO), un nuevo método de aprendizaje por refuerzo para LLM que reemplaza el enmascaramiento de gradiente rígido utilizado en enfoques previos basados en divergencia con un regularizador cuadrático suave ponderado por la ventaja para proporcionar señales correctivas continuas y mejorar la estabilidad del entrenamiento.

Autores originales: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante muy talentoso pero ligeramente caótico (la IA) a realizar un examen difícil. El estudiante ya ha aprendido los conceptos básicos, pero ahora quieres que aprenda a resolver problemas específicos y complicados de mejor manera. Para ello, le das preguntas de práctica, dejas que responda y luego le dices: "¡Buen trabajo!" o "¡Inténtalo de nuevo!" según qué tan bien lo haya hecho. Este proceso se llama Aprendizaje por Refuerzo (RL).

Sin embargo, hay un inconveniente: el estudiante practica en una biblioteca silenciosa (entrenamiento), pero realiza el examen real en una sala de exámenes ruidosa y caótica (inferencia). Debido a que los entornos son ligeramente diferentes, el estudiante podría confundirse o cambiar sus hábitos de forma demasiado drástica, lo que provocaría un colapso donde olvida todo lo que sabía.

Para prevenir esto, los profesores utilizan una "zona de seguridad" (Región de Confianza). Esta zona dice: "Puedes cambiar tus respuestas para mejorar, pero no las cambies demasiado, o perderás el equilibrio".

El Problema: Las Reglas Antiguas Eran Demasiado Rígidas

Durante mucho tiempo, los profesores utilizaron un método llamado PPO (Optimización de Política Próxima). Piensa en PPO como un libro de reglas estricto: "Si tu respuesta cambia más de un 20%, ¡detente! Corta todo el crédito para esa respuesta".

El artículo señala dos grandes fallos con este enfoque:

  1. La Trampa de la "Proporción": PPO mide el cambio observando cuánto cambiaron las probabilidades de una respuesta. En un mundo con millones de palabras posibles (como un diccionario con más de 50,000 palabras), una palabra muy poco común (como "xilófono") podría pasar de un 0.0001% de probabilidad a un 0.001%. ¡Eso es un cambio de proporción enorme (10 veces!), pero apenas importa en el gran esquema de las cosas. Mientras tanto, una palabra común (como "el") podría caer del 90% al 80%. Ese es un cambio de proporción pequeño, pero es un cambio masivo en el significado. PPO se confunde con esto, castigando demasiado las palabras raras y dejando que las palabras comunes se descontrolen.

  2. El Problema del "Corte Brusco": Métodos más nuevos (como DPPO) intentaron solucionar esto midiendo la cantidad real de cambio en la probabilidad (como medir la distancia recorrida en lugar del porcentaje). Pero utilizaban una "Máscara Dura". Imagina una pared. Si el estudiante da un paso un centímetro más allá de la pared, el profesor instantáneamente le da un golpe en la mano y dice: "¡Detente! No más aprendizaje para este paso". Es un interruptor binario: o recibes todo el crédito, o recibes cero. Esto crea un proceso de aprendizaje brusco e inestable. Si el estudiante está apenas ligeramente más allá de la pared, no recibe ayuda para volver a caminar; simplemente es ignorado.

La Solución: DRPO (El Guía Suave)

Los autores proponen un nuevo método llamado DRPO (Optimización de Política con Regularización de Divergencia).

En lugar de una pared dura o una regla de proporción estricta, imagina un trampolín inteligente y elástico que rodea la zona de seguridad.

  • Dentro de la Zona: Si el estudiante está realizando cambios buenos dentro de la zona de seguridad, el trampolín lo empuja suavemente hacia adelante, animándolo a seguir mejorando.
  • En el Borde: A medida que el estudiante se acerca al borde, el trampolín comienza a volverse más suave. No lo detiene abruptamente; simplemente lo ralentiza gradualmente.
  • Fuera de la Zona: Si el estudiante accidentalmente da un paso demasiado lejos (un movimiento "malo"), el trampolín no solo lo corta. En su lugar, lo hace rebotar de vuelta. Aplica una fuerza correctiva suave que dice: "Vaya, fuiste demasiado lejos. Vamos a traerte de vuelta hacia el centro".

Por qué esto funciona mejor

El artículo afirma que DRPO es como una guía suave y continua en lugar de un interruptor quebradizo de encendido/apagado.

  1. Maneja mejor la "Cola Larga": En el mundo de la IA, existen miles de palabras raras. DRPO mide la "distancia" real que se movió una palabra, no la "proporción". Esto significa que no se confunde cuando una palabra rara salta de casi cero a un número diminuto. Trata el cambio de manera justa, independientemente de qué tan común sea la palabra.

  2. Nunca deja de aprender: Incluso cuando el estudiante comete un error y sale de la zona de seguridad, DRPO no desecha la lección. Utiliza el error para guiar suavemente al estudiante de regreso. Esto evita que el entrenamiento se vuelva inestable o "colapse".

  3. Funciona en todas partes: Los autores probaron DRPO en diferentes tamaños de modelos de IA (desde pequeños hasta enormes), diferentes tipos de chips de computadora e incluso cuando la computadora funciona con una precisión menor (como usar una lente ligeramente borrosa). En cada caso, DRPO fue más estable y ayudó a la IA a aprender más rápido y mejor que los métodos antiguos.

La Conclusión

Piensa en los métodos antiguos como un profesor que o te grita "¡DETENTE!" en el momento en que cometes un error minúsculo, o te ignora por completo si te desvías ligeramente del camino.

DRPO es como un entrenador sabio que dice: "Lo estás haciendo genial, pero te estás alejando un poco demasiado. Vamos a ir más despacio. Si vas demasiado lejos, te atraeré suavemente de vuelta para que no te caigas". Esta corrección suave y continua hace que todo el proceso de aprendizaje sea mucho más seguro, rápido y confiable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →