OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL es un marco de código abierto que permite el entrenamiento de extremo a extremo de agentes de IA nativos de arnés en diversos entornos mediante el desacoplamiento de la inferencia del entrenamiento a través de un proxy ligero y un orquestador de Kubernetes, logrando un rendimiento de vanguardia en complejos bancos de pruebas de herramientas y GUI al tiempo que proporciona información sobre cómo las elecciones del arnés y el aprendizaje por refuerzo moldean el comportamiento del agente.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde las computadoras no solo responden preguntas, sino que realmente hacen cosas por ti. Pueden escribir código, reservar vuelos o organizar tus archivos digitales. Para que esto suceda, los científicos han construido "agentes de IA": programas inteligentes que pueden pensar, planificar y usar herramientas. Pero aquí está la parte difícil: estos agentes no trabajan en el vacío. Necesitan un "harness" (arnés o soporte), que es como una sala de control compleja o una cabina especializada. Este harness gestiona la memoria del agente, lo conecta a internet y le ayuda a usar herramientas como una calculadora o un navegador web. Piensa en el harness como el asiento del piloto y en el agente como el piloto; no puedes simplemente entrenar a un piloto en un videojuego y esperar que vuele un 747 real. El avión real tiene botones específicos, protocolos de emergencia y una disposición de cabina que el videojuego nunca mostró.
Durante mucho tiempo, hubo un gran problema: los "videojuegos" (entornos de entrenamiento simples) no coincidían con los "aviones reales" (los harnesses complejos utilizados en el mundo real). Los investigadores podían entrenar agentes fácilmente, pero cuando los ponían en los harnesses reales y desordenados, los agentes se confundían o fallaban. Este artículo, titulado "OpenForge RL", aborda precisamente ese desajuste. Introduce una nueva forma de entrenar a estos pilotos digitales directamente dentro de las cabinas reales en las que eventualmente volarán, utilizando un sistema que les permite practicar en miles de "aviones" diferentes al mismo tiempo sin colapsar toda la instalación de entrenamiento.
El Problema: Entrenar en un Videojuego vs. Volar el Avión Real
Imagina que estás tratando de enseñarle a un robot a reparar un coche. Si lo entrenas en un videoj juego simple donde el motor es solo un botón rojo y la llanta es un cuadrado azul, el robot aprende a presionar lo rojo y agarrar lo azul. Pero cuando pones a ese robot en un garaje real con un motor real, una llanta real y un millón de otras herramientas, se queda paralizado. No sabe cómo manejar la complejidad real.
Esto es lo que ha estado sucedendo con los agentes de IA. Los agentes modernos son potentes, pero dependen de "harnesses" sofisticados (como Claude Code o Codex) para gestionar sus pensamientos y herramientas. Estos harnesses son como la cabina real: tienen memoria con estado (recordando lo que pasó cinco pasos atrás), flujos de trabajo de procesos múltiples (ejecutando varias cosas a la vez) y conexiones de herramientas complejas. Sin embargo, las formas estándar en que los investigadores entrenan a la IA (usando Aprendizaje por Refuerzo) generalmente asumen un entorno simple y plano. Intentan entrenar al agente en una versión simplificada del harness, lo que crea un "desajuste entre entrenamiento y despliegue". Es como entrenar a un piloto en un simulador que no tiene los frenos de emergencia reales, y luego esperar que aterrice un avión real cuando los frenos fallan.
La Solución: OpenForge RL (El Garaje en la Nube)
Los autores de este artículo construyeron OpenForge RL, un marco que actúa como un enorme garaje basado en la nube. En lugar de intentar forzar el harness real y complejo dentro de una caja de entrenamiento simple, OpenForge RL hace lo contrario: toma la caja de entrenamiento y la envía al harness real.
Así es como funciona, usando una analogía lúdica:
- Los Pods Remotos (El Garaje en la Nube): Imagina que tienes una flota de pequeños garajes autónomos en la nube. Cada garaje es un contenedor que alberga un "harness" específico (como un modelo de coche específico). OpenForge RL utiliza un "orquestador Kubernetes" (piensa en él como un gerente de garaje súper eficiente) para levantar miles de estos garajes remotos instantáneamente.
- El Proxy (El Espejo de Doble Vía): Dentro de cada garaje, el agente de IA intenta resolver una tarea. Un "proxy ligero" actúa como un espejo de doble vía. Permite que el agente hable con el harness real y el entorno real (como una computadora real o un navegador web), pero registra secretamente cada movimiento, pensamiento y clic de herramienta.
- El Bucle de Entrenamiento: El proxy envía estos "registros de vuelo" grabados de vuelta al cerebro de entrenamiento principal (que utiliza herramientas estándar como veRL). El cerebro aprende de estos registros del mundo real, actualiza el cerebro del agente y envía la nueva versión de vuelta a los garajes remotos para intentarlo de nuevo.
La magia es que el entrenamiento ocurre dentro del harness real, en el entorno real, pero el trabajo pesado de gestionar todos esos entornos diferentes es manejado por la nube. Esto significa que los investigadores pueden entrenar agentes en "ZeroClaw", "OpenClaw", "Codex" o incluso agentes de GUI visual (agentes que usan ratón y teclado) todos a la vez, sin necesidad de reescribir su código de entrenamiento para cada nueva herramienta.
Lo Que Encontraron: El Entrenamiento Real Funciona Mejor
El equipo probó este sistema con dos tipos de agentes: Agentes Claw (que usan texto y herramientas para hacer cosas como buscar correos electrónicos o gestionar archivos) y Agentes GUI (que miran una pantalla y usan un ratón para hacer clic en botones en un navegador web o computadora).
Entrenaron estos agentes usando solo unos pocos cientos a unos pocos miles de tareas—mucho menos que algunos modelos masivos que usan millones. Los resultados fueron impresionantes:
- Para Agentes Claw: Su modelo, OpenForge-Claw, obtuvo una puntuación de 31.7 (pass@3) en el benchmark ClawEval y 33.7 en QwenClawBench. Esto fue significativamente mejor que otros modelos de código abierto de un tamaño similar (alrededor de 30 mil millones de parámetros). De hecho, funcionó mejor que algunos modelos que son varias veces más grandes.
- Para Agentes GUI: Su modelo, OpenForge-GUI, alcanzó una puntuación de 37.7 en OSWorld-Verified, 63.0 en Online-Mind2Web y 72.3 en WebVoyager. Esto es importante porque las tareas de GUI son increíblemente difíciles; el agente tiene que "ver" la pantalla y determinar dónde hacer clic. OpenForge-GUI igualó o incluso superó a modelos que eran mucho más grandes y que habían sido entrenados con mucha más información.
La Lección del "Harness": No Todas las Cabinas Son Iguales
Uno de los descubrimientos más interesantes no fue solo que el entrenamiento funcionó, sino cómo diferentes harnesses afectaron el aprendizaje. Los autores probaron sus agentes en cuatro harnesses diferentes: ReACT (un bucle simple), ZeroClaw (ligero), OpenClaw y Codex (muy complejo).
Encontraron que algunos harnesses son mucho más difíciles de aprender que otros.
- Los harnesses más simples y mejor alineados (como ZeroClaw) permitieron que los agentes aprendieran más rápido y funcionaran mejor.
- Los harnesses más complejos (como Codex) fueron más difíciles de dominar. Los agentes tuvieron más dificultades y, aunque el Aprendizaje por Refuerzo (RL) ayudó, las ganancias fueron menores en comparación con los harnesses más simples.
Esto sugiere que el diseño de la "cabina" importa tanto como el entrenamiento del piloto. Un harness bien diseñado hace que el agente sea más inteligente y confiable.
Qué Enseñó Realmente el RL a los Agentes
Los autores también observaron de cerca qué aprendieron realmente los agentes cuando añadieron el Aprendizaje por Refuerzo (RL) sobre el entrenamiento básico (SFT). Descubrieron que el RL no solo los hizo "más inteligentes" en un sentido general; mejoró específicamente la fiabilidad:
- Autoverificación: Los agentes comenzaron a verificar su propio trabajo. Por ejemplo, si creaban un archivo, era más probable que lo leyeran de nuevo para asegurarse de que fuera correcto.
- Cobertura de Herramientas: Comenzaron a usar una variedad más amplia de herramientas en lugar de limitarse a una o dos que conocían bien.
- Recuperación de Errores: Esta fue la parte complicada. Aunque el RL ayudó a los agentes a recuperarse de errores pequeños, la recuperación de errores siguió siendo débil. Incluso después del entrenamiento, si un agente cometía un error grande, a menudo no podía corregirlo y simplemente se rendía. Los autores sugieren que esta habilidad específica podría necesitar datos especiales o métodos de entrenamiento diferentes para dominarse.
La Conclusión
OpenForge RL demuestra que no es necesario simplificar el mundo real para entrenar agentes de IA. Al usar un sistema basado en la nube que desacopla el entrenamiento del entorno, se puede entrenar a los agentes directamente en los harnesses complejos y desordenados del mundo real que realmente utilizarán.
El artículo sugiere que este enfoque permite a los investigadores construir agentes que no solo sean más capaces, sino también más confiables en sus trabajos específicos. Aunque los agentes todavía tienen dificultades con la recuperación de errores complejos, la capacidad de entrenarlos en la "cabina real" en lugar de en un "videojuego" es un gran paso adelante. Esto significa que, en el futuro, podríamos ver agentes de IA que estén verdaderamente listos para trabajar junto a nosotros, no solo en simulaciones, sino en las herramientas digitales reales que usamos todos los días.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.