Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
Este artículo presenta un nuevo método de post-entrenamiento para modelos de lenguaje grandes que mejora la Optimización de Política Relativa Grupal (GRPO) promediando los logits de una política de referencia SFT congelada y una política entrenable, eliminando así la necesidad de regularización KL o de un crítico, al tiempo que combina eficazmente las capacidades de razonamiento del RL con la estabilidad de formato del SFT.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El panorama general: Dos profesores, un estudiante
Imagina que estás entrenando un modelo de lenguaje grande (una IA) para resolver problemas de matemáticas. Tienes dos "profesores" distintos intentando enseñarle:
- El profesor de formato (SFT): Este profesor es excelente enseñando a la IA cómo escribir respuestas ordenadamente, usar los símbolos correctos y seguir reglas estrictas (como encerrar la respuesta final en un recuadro). Sin embargo, este profesor a veces comete errores en la lógica matemática real.
- El profesor de razonamiento (RL): Este profesor es un genio de las matemáticas que puede resolver ecuaciones complejas perfectamente. Pero, este profesor es desordenado; a menudo olvida encerrar la respuesta en un recuadro, salta pasos o escribe en un formato extraño que no coincide con lo que requiere el examen.
El problema:
Tradicionalmente, cuando intentas combinar estos dos, utilizas un método llamado "Regularización KL". Piensa en esto como una banda elástica que ata al profesor de razonamiento al profesor de formato. La banda elástica fuerza al profesor de razonamiento a mantenerse cerca del estilo del profesor de formato.
- La trampa: Si el profesor de formato comete un error matemático, la banda elástica arrastra al profesor de razonamiento hacia ese mismo error. La IA se queda atrapada intentando ser "ordenada" pero falla en ser "inteligente".
La nueva solución: Promedio de logits
Los autores de este artículo proponen una nueva forma de combinar estos profesores. En lugar de atarlos juntos con una banda elástica, crean una Voz Mezclada.
Imagina que la IA es un coro. En lugar de forzar a los cantantes a mantenerse en un unísono perfecto (lo cual limita su rango), el nuevo método mezcla sus voces antes de que canten.
- Si el profesor de formato dice: "Encierra la respuesta en un recuadro", y el profesor de razonamiento dice: "La respuesta es 5", la Voz Mezclada dice: "Encierra la respuesta en un recuadro: 5".
- Si el profesor de formato comete un error matemático (diciendo que la respuesta es 6), pero el profesor de razonamiento sabe que es 5, la Voz Mezclada se inclina fuertemente hacia las matemáticas del profesor de razonamiento mientras mantiene la instrucción del profesor de formato de "encuadrarlo".
Cómo funciona (La magia de los "logits")
En términos de IA, la "voz" del modelo está compuesta por números llamados logits (que representan la probabilidad de que el modelo elija una palabra o número específico a continuación).
- La mezcla: Los investigadores toman los números del profesor de formato y del profesor de razonamiento y los promedian matemáticamente.
- El resultado: Esto crea una nueva "Política Mezclada" temporal.
- El entrenamiento: La IA aprende practicando sobre esta Política Mezclada. Recibe una recompensa (puntos) si la respuesta final es correcta.
- Debido a que el profesor de formato es parte de la mezcla, la IA nunca olvida cómo escribir ordenadamente.
- Debido a que el profesor de razonamiento es parte de la mezcla, la IA tiene libertad para corregir los errores matemáticos del profesor de formato.
Por qué esto es mejor (El "Producto de Expertos")
El artículo utiliza un concepto llamado "Producto de Expertos". Piensa en ello como una decisión de comité:
- Si el Experto A (Formato) está seguro sobre el estilo, y el Experto B (Razonamiento) está seguro sobre las matemáticas, la decisión final es fuerte en ambos aspectos.
- Si el Experto A está equivocado sobre las matemáticas, la confianza del Experto B la supera, pero la confianza del Experto A sobre el estilo permanece.
El artículo encontró que este enfoque de "Voz Mezclada" funciona mejor que el antiguo método de "banda elástica". La IA aprendió a resolver problemas de matemáticas correctamente y mantuvo su formato ordenado, mientras que el método antiguo a menudo hacía que la IA olvidara cómo formatear correctamente o se quedara atrapada en los errores matemáticos del profesor de formato.
Los experimentos
Los investigadores probaron esto en tres "exámenes" diferentes (conjuntos de datos):
- MATH: Problemas de matemáticas difíciles.
- cn-k12: Matemáticas de secundaria/preparatoria chinas.
- MMLU: Conocimiento general y razonamiento.
Lo probaron en tres tamaños diferentes de modelos de IA (pequeño, mediano y grande).
Los resultados:
- En casi todos los casos, el nuevo método de "Voz Mezclada" obtuvo puntuaciones más altas que el método tradicional.
- Fue especialmente bueno corrigiendo un problema específico: El método tradicional a menudo hacía que la IA "olvidara" cómo formatear respuestas a medida que aprendía a resolver matemáticas más difíciles. El nuevo método mantuvo las habilidades de formato intactas mientras mejoraba las habilidades matemáticas.
Un ejemplo concreto del artículo
El artículo da un ejemplo específico de un problema de geometría:
- El profesor de formato (SFT): Configura correctamente la ecuación pero comete un error matemático, concluyendo que el radio es 6. Encierra la respuesta ordenadamente en un recuadro.
- El profesor de razonamiento (RL): Calcula correctamente las matemáticas, encontrando que el radio es 5, pero olvida encerrar la respuesta en un recuadro o escribirla en el formato final.
- La Voz Mezclada: Toma las matemáticas correctas (5) del profesor de razonamiento y la instrucción ordenada de encuadrar del profesor de formato. La salida final es un 5 ordenadamente encerrado en un recuadro.
Resumen
El artículo introduce una forma de entrenar modelos de IA que actúa como un equipo colaborativo en lugar de una jerarquía estricta. Al promediar matemáticamente los "pensamientos" (logits) de un profesor ordenado pero desordenado y un profesor inteligente pero desordenado, la IA aprende a ser tanto inteligente como ordenada, evitando las trampas de forzar a uno a seguir estrictamente al otro.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.