← Últimos artículos
🤖 AI

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL es un marco de trabajo que permite el aprendizaje por refuerzo escalable para agentes de codificación mediante el puente entre entornos de ejecución nativos y la optimización de gradiente de política a través de la intermediación de LLM en proceso, la orquestación robusta de sandboxes y el monitoreo integrado, mejorando significamente el rendimiento del modelo en SWE-bench Verified a través de diversos entornos mientras mantiene una alta alineación entre entrenamiento e inferencia.

Autores originales: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, los investigadores están enseñando a las computadoras a actuar como ingenieros de software autónomos. Estos agentes digitales no se limitan a responder preguntas; navegan por bases de código complejas, utilizan herramientas para corregir errores y ejecutan pruebas para ver si sus cambios funcionan. Para aprender estas habilidades, los agentes utilizan un método llamado aprendizaje por refuerzo. Imagine a un estudiante aprendiendo a resolver un rompecabezas: intenta un movimiento y, si este lo acerca a la solución, recibe una pequeña recompensa. Con el tiempo, aprende qué movimientos conducen al éxito. Para los agentes de programación, este proceso implica generar secuencias largas de acciones, observar la ejecución de un programa informático y recibir una señal simple de "sí" o "no" que indica si el código que escribieron realmente solucionó el problema. El desafío radica en que estos agentes operan en entornos informáticos del mundo real que son desordenados, donde las cosas pueden salir mal de formas impredecibles. Si el entorno falla, si el sistema de recompensa es engañado, o si la computadora que registra los pensamientos del agente pierde el rastro de lo que realmente se dijo, el proceso de aprendizaje se rompe. El agente podría aprender a explotar el sistema o simplemente dejar de aprender porque la retroalimentación que recibe no es fiable.

Un equipo de investigadores ha desarrollado un nuevo sistema llamado LEGO-RL para resolver estos problemas específicos. Su objetivo era conectar agentes de programación existentes y complejos con potentes algoritmos de aprendizaje sin obligar a los agentes a cambiar su forma de trabajar. Piense en el agente como un trabajador experto que sabe exactamente cómo usar un conjunto específico de herramientas y seguir un flujo de trabajo determinado. Los intentos anteriores de entrenar a estos trabajadores a menudo requerían reconstruir todo su espacio de trabajo para que se ajustara al software de entrenamiento, lo que frecuentemente causaba errores o cambiaba el comportamiento natural del trabajador. El equipo de LEGO-RL, en cambio, construyó un puente que permite al software de entrenamiento observar al trabajador exactamente como es, capturando cada movimiento y pensamiento en tiempo real mientras protege el proceso de aprendizaje del caos del mundo real.

El núcleo de su solución es un marco de trabajo que garantiza que la computadora de entrenamiento vea exactamente lo que el agente ve y hace. Cuando un agente genera una respuesta, un componente especial captura el flujo bruto de palabras y la probabilidad exacta que el agente asignó a cada palabra antes de que cualquier otro software pudiera alterarla o resumirla. Esto es crucial porque el software que gestiona el entorno del agente a menudo reescribe la historia o comprime la información para ahorrar espacio. Si el sistema de entrenamiento dependiera de estas versiones reescritas, calcularía el progreso de aprendizaje del agente basándose en una memoria distorsionada de los eventos. Al capturar los datos en el momento de la generación, los investigadores aseguraron que la señal de aprendizaje se mantiera fiel a las decisiones reales del agente. Además, construyeron un sistema para reproducir las elecciones internas específicas que realizó el agente, asegurando que incluso los modelos complejos con múltiples partes especializadas aprendieran del camino correcto.

Para mantener la fiabilidad del proceso de aprendizaje, el equipo creó un entorno altamente organizado donde cada prueba se ejecuta en su propio contenedor aislado y seguro. Esto evita que una prueba fallida bloquee todo el sistema y evita que los agentes encuentren atajos para eludir el sistema de puntuación. Por ejemplo, ocultaron las respuestas a los agentes durante la prueba y aseguraron que el software utilizado para calificar el trabajo no pudiera ser manipulado. También diseñaron el sistema para manejar los fallos con elegancia. Si un agente se queda estancado o el entorno falla, el sistema identifica el problema, descarta ese intento específico y continúa sin permitir que el error corrompa los datos de aprendizaje. Esto permite que el entrenamiento continúe sin problemas incluso cuando las pruebas individuales fallan, lo cual sucede con frecuencia en tareas de programación complejas.

Los investigadores probaron este sistema entrenando un modelo de lenguaje de gran tamaño utilizando tres marcos de agentes de programación diferentes y existentes. Encontraron que el sistema funcionaba notablemente bien en los tres casos. La capacidad del modelo para resolver problemas de software del mundo real mejoró significamente. Al usar un marco popular, la tasa de éxito saltó del 64 por ciento a más del 70 por ciento. Con otro, aumentó del 62 por ciento a casi el 68 por ciento, y con un tercero, subió del 57 por ciento a casi el 67 por ciento. Crucialmente, los investigadores verificaron que el proceso de aprendizaje era honesto; la relación matemática entre lo que el agente hizo y lo que el sistema de entrenamiento calculó se mantuvo casi perfecta, con una correlación superior al 99 por ciento. Esto demostró que el sistema no solo estaba teniendo suerte, sino que estaba aprendiendo genuinamente de los datos correctos.

Más allá de simplemente mejorar las puntuaciones, el sistema proporcionó una ventana clara hacia cómo aprendían los agentes. Los investigadores pudieron observar el entrenamiento en tiempo real, viendo exactamente por qué fallaba una prueba o cómo cambiaba el comportamiento del agente a lo largo de semanas de entrenamiento. Observaron que, a medida que los agentes mejoraban, comenzaban a revisar su propio trabajo con más frecuencia, leyendo los archivos que acababan de editar para asegurar que sus cambios fueran correctos. También notaron que los agentes empezaban a dar más pasos para resolver problemas, entablando conversaciones más largas y complejas con la computadora para alcanzar una solución. Este nivel de detalle permitió a los investigadores diagnosticar problemas rápidamente, como cuando un agente dejaba de usar herramientas y empezaba a escribir texto en su lugar, y ajustar el entrenamiento en consecuencia.

El éxito de LEGO-RL demuestra que escalar el entrenamiento de los agentes de programación requiere más que solo computadoras más rápidas o modelos más grandes. Exige un sistema que respete la integridad del flujo de trabajo del agente mientras proporciona un entorno estable y observable para el aprendizaje. Al construir un marco que captura los datos fielmente, protege contra errores y ofrece una visibilidad profunda en el proceso de aprendizaje, los investigadores han demostrado que es posible enseñar a agentes de programación complejos a mejorar de manera fiable. Su trabajo sugiere que el futuro de la programación autónoma no reside en forzar a los agentes a entrar en moldes rígidos, sino en construir sistemas flexibles y robustos que puedan aprender de la realidad desordenada del desarrollo de software.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →