SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
SPO++ mejora la eficiencia del aprendizaje en línea del aprendizaje por refuerzo agéntico asíncrono mediante la corrección del desajuste entre el centrado de la ventaja a nivel de trayectoria y la optimización del actor ponderada por tokens a través de la normalización de la medida de acción-token y la organización de evidencia alineada con eventos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el campo de la inteligencia artificial, que evoluciona rápidamente, los investigadores están enseñando a los programas informáticos a resolver problemas complejos permitiéndoles intentar, fallar y aprender de los resultados. Este proceso, conocido como aprendizaje por refuerzo, es particularmente útil para entrenar grandes modelos de lenguaje para que actúen como agentes que pueden usar herramientas, navegar por entornos virtuales o resolver problemas matemáticos. Un desafío central en este trabajo es cómo medir el éxito cuando el camino hacia una respuesta es largo e impredecible. Los métodos tradicionales a menudo requieren que el sistema genere muchos intentos diferentes del mismo problema simultáneamente, esperando a que cada uno termine antes de poder aprender de los resultados. Esto crea un cuello de botella: si un intento tarda mucho tiempo en completarse porque se queda atascado o intenta muchas herramientas, todo el proceso de aprendizaje se detiene, esperando a que ese intento más lento se ponga al día.
Para resolver esta ineficiencia, se desarrolló un enfoque más nuevo llamado Optimización de Política de Flujo Único (Single-stream Policy Optimization). En lugar de esperar a un grupo de intentos, este método permite que el sistema aprenda de un intento a la vez, utilizando una memoria persistente de éxitos y fracasos pasados para guiar decisiones futuras. Sin embargo, un equipo de investigadores liderado por Kai Ruan y Jinghao Lin descubrió que, si bien este método eliminó el tiempo de espera, introdujo un desajuste sutil pero significativo en la forma en que la computadora calculaba su progreso. Encontraron que la forma en que el sistema promediaba sus recompensas no se alineaba con la forma en que realmente procesaba los pasos de una solución. Al corregir esta alineación, crearon una versión mejorada del método, que llamaron SPO++, que permite que la inteligencia artificial aprenda de manera significativamente más rápida y eficiente.
El núcleo del problema radicaba en cómo la computadora manejaba la longitud de sus respuestas. En el método original, el sistema calculaba una única puntuación para todo un intento, como si un robot lograra limpiar una habitación o un resolvedor de matemáticas encontrara la respuesta correcta. Luego, distribuía esta única puntuación a través de cada palabra o "token" que el modelo generaba durante ese intento. Esto parecía lógico, pero creaba una distorsión. Si un intento era muy largo y otro era corto, el intento largo diluía su puntuación entre muchas palabras, mientras que el intento corto concentraba su puntuación en pocas palabras. Cuando el sistema intentaba aprender de estas puntuaciones, la longitud de la respuesta cambiaba silenciosamente el centro de gravedad del aprendizaje, haciendo que el modelo optimizara las cosas equivocadas. Era como si el sistema estuviera tratando de equilibrar una balanza, pero los pesos en la balanza se desplazaran dependiendo de cuántos artículos se colocaran en ella, en lugar de depender del valor de los propios artículos.
Los investigadores identificaron dos áreas específicas donde ocurría este desalineamiento. Primero, el sistema estaba rastreando cuándo recibía los resultados de un intento en lugar de cuándo se generaba realmente el intento. En un sistema asíncrono donde las tareas se envían y se completan a diferentes velocidades, el orden en que llegan los resultados es a menudo aleatorio y depende de la velocidad de la red o de la carga de la computadora. El método original utilizaba este orden de llegada para actualizar su memoria, lo que significaba que la señal de aprendizaje estaba influenciada por la temporización del sistema informático en lugar de la lógica de la tarea en sí. Segundo, y más críticamente, el método de promediar las puntuaciones no tenía en cuenta el hecho de que el modelo aprende de cada palabra que genera, no solo del resultado final. Los investigadores se dieron cuenta de que, para arreglar el proceso de aprendizaje, necesitaban estandarizar las puntuaciones basadas en el número de palabras de acción generadas, asegurando que la señal de recompensa coincidiera con el volumen real de trabajo que el modelo estaba realizando.
Para abordar estos problemas, el equipo introdujo SPO++, que realiza dos cambios clave en el proceso de aprendizaje. Primero, reorganizaron el sistema de memoria para rastrear el "evento de política" (policy event), que es el momento específico en que se envió una solicitud, en lugar de cuando regresó el resultado. Esto asegura que la memoria del sistema sobre los éxitos pasados esté ligada al estado del modelo en el momento en que se creó la tarea, haciendo que la señal de aprendizaje sea consistente independientemente de cuánto tiempo tardó en terminar la tarea. Segundo, cambiaron la forma en que se promedian las puntuaciones. En lugar de tratar cada intento como una unidad única, el nuevo método calcula la puntuación promedio basada en el número total de palabras de acción generadas en todos los intentos. Esto asegura que la señal de aprendizaje esté perfectamente alineada con la forma en que el modelo actualiza sus conocimientos, palabra por palabra.
Los resultados de estos cambios fueron probados en dos tipos diferentes de tareas: un conjunto de 128 tareas domésticas simuladas donde un agente debe mover objetos a ubicaciones específicas, y un conjunto de datos de 1,500 problemas matemáticos que requieren el uso de una calculadora Python. Los investigadores realizaron experimentos utilizando dos tamaños diferentes de modelos de lenguaje, uno con 0.8 mil millones de parámetros y otro con 2 mil millones de parámetros. En cada una de las pruebas, el nuevo método, SPO++, aprendió más rápido que el enfoque original. En la tarea de las tareas domésticas, la mejora fue sustancial, con el nuevo método logrando una recompensa total significativamente mayor a lo largo del entrenamiento. En los problemas matemáticos, las ganancias fueron menores pero constantes, mostrando que el modelo alcanzaba un nivel de rendimiento más alto con mayor rapidez. Los investigadores encontraron que la parte más poderosa del nuevo método fue el cambio en la forma en que se promediaban las puntuaciones, lo cual, por sí solo, representó la mayor parte de la mejora.
Estos hallazgos sugieren que, en el complejo mundo del entrenamiento de agentes de inteligencia artificial, los detalles de cómo se procesan los datos pueden ser tan importantes como los datos mismos. Al asegurar que la forma en que un sistema mide su progreso coincida con la forma en que realmente aprende, los investigadores pueden desbloquear ganancias significativas de eficiencia sin necesidad de más potencia de cómputo o modelos más grandes. El trabajo demuestra que incluso los pequeños desalineamientos en el proceso de aprendizaje pueden frenar el progreso, y que corregir estos desajustes permite que el sistema se concentre su energía en resolver el problema en lugar de compensar una medición defectuosa. A medida que la inteligencia artificial continúa abordando tareas más difíciles y variadas, métodos como SPO++ ofrecen un camino más claro, asegurando que cada paso que da el modelo se mida con precisión y contribuya efectivamente a su crecimiento.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.