AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
Este artículo presenta AIRL-S, un marco unificado que combina el Aprendizaje por Refuerzo Inverso Adversario con la Optimización de Política Relativa de Grupo para inferir recompensas densas y paso a paso a partir de trayectorias de referencia, eliminando así la necesidad de datos de proceso etiquetados y permitiendo un escalado en tiempo de prueba robusto y rentable que alcanza un rendimiento de nivel GPT-4o en evaluaciones de matemáticas, ciencia y generación de código.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los modelos de lenguaje extensos son los potentes motores detrás de muchos sistemas modernos de inteligencia artificial, capaces de generar texto, resolver problemas y escribir código. Durante años, los investigadores han intentado que estos sistemas sean más inteligentes enseñándoles a pensar a través de los problemas paso a paso, un método conocido como "cadena de pensamiento" (chain of thought). Sin embargo, enseñar a un modelo a razonar bien es difícil porque la computadora a menudo solo sabe si la respuesta final es correcta o incorrecta, pero no si los pasos que llevaron a ella fueron lógicos. Para solucionar esto, los científicos han probado dos enfoques principales. Uno consiste en entrenar al modelo con recompensas solo al final de una tarea, lo cual puede ser inestable e ineficiente. El otro utiliza un guía separado para verificar cada uno de los pasos del proceso de razonamiento, pero la creación de este guía suele requerir expertos humanos costosos para etiquetar miles de ejemplos, y el guía a menudo falla cuando el modelo comienza a pensar de formas nuevas.
Un equipo de investigadores ha introducido un nuevo sistema llamado AIRL-S que unifica estos dos enfoques en un único bucle de automejora. En lugar de depender de etiquetas humanas para cada paso, el sistema aprende a crear su propio guía interno mediante la observación de ejemplos de razonamiento de alta calidad. Luego, utiliza este guía tanto para entrenar al modelo como para ayudarlo a buscar las mejores respuestas durante el uso en el mundo real. En pruebas realizadas en ocho bancos de pruebas distintos que involucran matemáticas, ciencia y programación, los investigadores descubrieron que este método mejoró el rendimiento del modelo en un promedio del nueve por ciento respecto a su versión inicial. El sistema resultante se desempeñó tan bien como los modelos comerciales más avanzados disponibles, como GPT-4o, sin necesidad de la costosa supervisión humana que requerían los métodos anteriores.
La innovación central radica en cómo el sistema aprende a juzgar su propio trabajo. Tradicionalmente, para enseñar a un modelo a razonar paso a paso, los investigadores necesitarían un "modelo de recompensa de proceso" (process reward model), un programa separado entrenado con datos donde los humanos habían marcado cada paso correcto e incorrecto. Esto es lento y costoso. El nuevo método evita esto utilizando una técnica llamada aprendizaje adversarial. Imagine que el sistema juega un juego donde una parte intenta generar pasos de razonamiento y otra parte intenta distinguir entre esos pasos generados y un conjunto de ejemplos de referencia de alta calidad. A través de esta competencia, el sistema aprende a reconocer qué es un buen paso de razonamiento sin que un humano se lo diga explícitamente. Este guía aprendido, o modelo de recompensa, se vuelve denso y detallado, ofreciendo retroalimentación sobre cada uno de los pasos del proceso de razonamiento en lugar de solo sobre el resultado final.
Una vez que el sistema ha aprendido este guía interno, lo utiliza de dos maneras simultáneamente. Primero, utiliza el guía para entrenar al modelo principal, alentándolo a dar mejores pasos durante la fase de aprendizaje. Segundo, conserva el mismo guía para actuar como verificador durante la fase de resolución de problemas. Cuando se le pide al modelo que resuelva un problema difícil, este puede generar muchas soluciones posibles diferentes. El guía aprendido entonces califica cada paso de estas soluciones potenciales, ayudando al sistema a seleccionar el camino más lógico. Esto crea un flujo de trabajo unificado donde la herramienta utilizada para enseñar al modelo es la misma herramienta utilizada para ayudarlo a pensar durante una prueba. Los investigadores demostraron que este guía es robusto; funciona eficazmente incluso cuando se aplica a diferentes modelos o diferentes estrategias de búsqueda, lo que sugiere que el conocimiento que aprendió es general y transferible.
Los resultados de este enfoque se midieron a través de una amplia gama de tareas desafiantes. Los investigadores probaron su modelo en ocho bancos de pruebas estándar, incluyendo competencias matemáticas complejas, preguntas de razonamiento científico y desafíos de programación. El modelo, que comenzó como un modelo de lenguaje de código abierto estándar, mejoró su precisión promedio en un nueve por ciento tras ser entrenado con este nuevo método. En tareas matemáticas y científicas específicas, la mejora fue incluso mayor, alcanzando un trece por ciento. Al compararse con otros modelos que han sido entrenados con datos etiquetados por humanos costosos u otras técnicas avanzadas de aprendizaje por refuerzo, este nuevo sistema se desempeñó consistentemente mejor. Incluso igualó el rendimiento de GPT-4o, un modelo comercial de primer nivel, a pesar de tener significativamente menos parámetros. Esto sugiere que la calidad del proceso de razonamiento, guiado por este sistema de recompensa autoaprendido, es más importante que simplemente tener un modelo más grande.
Un hallazgo clave del estudio es cómo funcionan juntos los dos tipos diferentes de señales de aprendizaje. El sistema combina la retroalimentación detallada paso a paso de su guía autoaprendida con las recompensas del resultado final de los métodos tradicionales. Los investigadores descubrieron que depender de un solo tipo de señal era menos efectivo. El guía paso a paso ayudó al modelo a explorar mejores caminos de razonamiento, mientras que la señal del resultado final aseguró que el modelo se mantuviera enfocado en obtener la respuesta correcta. Cuando se equilibraron correctamente, estas dos señales se reforzaron mutuamente, conduciendo a un entrenamiento más estable y mejores resultados. Además, el sistema mostró que podía utilizar este guía aprendido para mejorar varios métodos de búsqueda, como aquellos que intentan muchas soluciones diferentes a la vez o aquellos que construyen un árbol de posibilidades. El guía fue particularmente efectivo en escenarios de búsqueda complejos donde el modelo tenía que evaluar el valor de los pasos intermedios para tomar la mejor decisión.
Las implicaciones de este trabajo se extienden más allá de simplemente obtener puntuaciones más altas en las pruebas. Al eliminar la dependencia de anotaciones humanas costosas para el razonamiento paso a paso, este método ofrece una forma más escalable y rentable de mejorar la inteligencia artificial. Sugiere que los modelos pueden aprender a ser sus propios maestros, refinando sus capacidades de razonamiento mediante la observación de ejemplos de alta calidad y compitiendo contra sí mismos. Los investigadores señalaron que su enfoque es particularmente adecuado para tareas donde la respuesta final puede ser verificada automáticamente, como las matemáticas y la programación. Si bien el método es poderoso, los autores reconocen que actualmente depende de estos resultados verificables y puede requerir un mayor desarrollo para manejar tareas abiertas donde no existe una única respuesta correcta. No obstante, la capacidad de unificar el entrenamiento y la búsqueda en tiempo de inferencia en un sistema único y eficiente marca un paso significativo hacia la creación de modelos de lenguaje extensos que sean razonadores más fiables y capaces.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.