OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL è un framework open-source che consente l'addestramento end-to-end di agenti IA nativi per harness in diversi ambienti, disaccoppiando l'inferenza dall'addestramento tramite un proxy leggero e un orchestratore Kubernetes, raggiungendo prestazioni allo stato dell'arte su benchmark complessi di strumenti e GUI fornendo al contempo approfondimenti su come le scelte di harness e l'apprendimento per rinforzo modellino il comportamento degli agenti.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate un mondo in cui i computer non si limitano a rispondere alle domande, ma compiono effettivamente delle azioni per voi. Possono scrivere codice, prenotare voli o organizzare i vostri file digitali. Per far sì che ciò accada, gli scienziati hanno costruito degli "agenti IA": programmi intelligenti capaci di pensare, pianificare e usare strumenti. Ma ecco la parte complicata: questi agenti non lavorano nel vuoto. Hanno bisogno di un "harness" (un sistema di controllo), che è come una cabina di pilotaggio complessa o specializzata. Questo harness gestisce la memoria dell'agente, lo connette a Internet e lo aiuta a usare strumenti come una calcolatrice o un browser web. Pensate all'harness come al sedile del pilota e all'agente come al pilota; non si può addestrare un pilota in un videogioco e aspettarsi che piloti un vero 747. L'aereo reale ha pulsanti specifici, protocolli di emergenza e una disposizione della cabina di pilotaggio che il videogioco non ha mai mostrato.
Per molto tempo, c'è stato un grande problema: i "videogiochi" (ambienti di addestramento semplici) non corrispondevano agli "aerei reali" (gli harness complessi usati nel mondo reale). I ricercatori potevano addestrare gli agenti facilmente, ma quando li inserivano negli harness reali, complessi e disordinati, gli agenti spesso si confondevano o fallivano. Questo articolo, intitolato "OpenForge RL", affronta esattamente questo disallineamento. Introduce un nuovo modo per addestrare questi piloti digitali direttamente all'interno delle vere cabine di pilotaggio che voleranno in seguito, utilizzando un sistema che permette loro di fare pratica su migliaia di "aerei" diversi contemporaneamente senza far crashare l'intera struttura di addestramento.
Il Problema: Addestramento in un Videogioco vs Volare con un Vero Aereo
Immaginate di cercare di insegnare a un robot come riparare un'auto. Se lo addestrate in un semplice videogioco dove il motore è solo un pulsante rosso e lo pneumatico è un quadrato blu, il robot imparerà a premere il rosso e afferrare il blu. Ma quando mettete quel robot in un vero garage con un vero motore, un vero pneumatico e un milione di altri strumenti, esso si blocca. Non sa come gestire la vera complessità.
Questo è ciò che è accaduto con gli agenti IA. Gli agenti moderni sono potenti, ma si affidano a "harness" sofisticati (come Claude Code o Codex) per gestire i loro pensieri e i loro strumenti. Questi harness sono come la vera cabina di pilotaggio: hanno una memoria statale (ricordano cosa è successo cinque passi fa), flussi di lavoro multi-processo (eseguono diverse cose contemporaneamente) e connessioni complesse con gli strumenti. Tuttavia, i modi standard con cui i ricercatori addestrano l'IA (usando l'Apprendimento per Rinforzo o Reinforcement Learning) assumono solitamente un ambiente semplice e piatto. Cercano di addestrare l'agente in una versione semplificata dell'harness, il che crea un "disallineamento tra addestramento e distribuzione" (train-deploy mismatch). È come addestrare un pilota su un simulatore che non ha i veri freni di emergenza, per poi aspettarsi che faccia atterrare un vero aereo quando i freni si guastano.
La Soliazione: OpenForge RL (Il Garage nel Cloud)
Gli autori di questo articolo hanno costruito OpenForge RL, un framework che funge da enorme garage basato sul cloud. Invece di cercare di forzare l'harness reale e complesso in una scatola di addestramento semplice, OpenForge RL fa l'opposto: prende la scatola di addestramento e la invia verso l'harness reale.
Ecco come funziona, usando un'analogia giocosa:
- I Pod Remoti (Il Garage nel Cloud): Immaginate di avere una flotta di piccoli garage a guida autonoma nel cloud. Ogni garage è un container che contiene un particolare "harness" (come un modello di auto specifico). OpenForge RL usa un "orchestratore Kubernetes" (pensate a un gestore di garage estremamente efficiente) per attivare istantaneamente migliaia di questi garage remoti.
- Il Proxy (Lo Specchio a Due Vie): All'interno di ogni garage, l'agente IA cerca di risolvere un compito. Un "proxy leggero" agisce come uno specchio a due vie. Permette all'agente di comunicare con l'harness reale e con l'ambiente reale (come un vero computer o un browser web), ma registra segretamente ogni singola mossa, pensiero e clic di uno strumento.
- Il Ciclo di Addestramento: Il proxy invia questi "registri di volo" registrati al cervello di addestramento principale (che utilizza strumenti standard come veRL). Il cervello impara da questi registri del mondo reale, aggiorna il cervello dell'agente e invia la nuova versione all'esterno verso i garage remoti per riprovare.
La magia è che l'addestramento avviene dentro l'harness reale, nell'ambiente reale, ma il lavoro pesante di gestione di tutti quei diversi ambienti è gestito dal cloud. Ciò significa che i ricercatori possono addestrare agenti su "ZeroClaw", "OpenClaw", "Codex" o persino agenti GUI (agenti che usano un mouse e una tastiera) tutti insieme, senza dover riscrivere il proprio codice di addestramento per ogni singolo nuovo strumento.
Cosa hanno scoperto: L'addestramento reale funziona meglio
Il team ha testato questo sistema con due tipi di agenti: Agenti Claw (che usano testo e strumenti per fare cose come cercare email o gestire file) e Agenti GUI (che guardano uno schermo e usano un mouse per cliccare pulsanti in un browser web o in un computer).
Hanno addestrato questi agenti usando solo poche centinaia o migliaia di compiti — molto meno rispetto ad alcuni modelli massicci che ne utilizzano milioni. I risultati sono stati impressionanti:
- Per gli Agenti Claw: Il loro modello, OpenForge-Claw, ha ottenuto un punteggio di 31.7 (pass@3) sul benchmark ClawEval e 33.7 su QwenClawBench. Questo è significativamente migliore di altri modelli open-source di dimensioni simili (circa 30 miliardi di parametri). In effetti, ha performato meglio di alcuni modelli che sono diverse volte più grandi.
- Per gli Agenti GUI: Il loro modello, OpenForge-GUI, ha raggiunto un punteggio di 37.7 su OSWorld-Verified, 63.0 su Online-Mind2Web e 72.3 su WebVoyager. Questo è un dato importante perché i compiti GUI sono incredibilmente difficili; l'agente deve "vedere" lo schermo e capire dove cliccare. OpenForge-GUI ha eguagliato o addirittura superato modelli molto più grandi che erano stati addestrati su una quantità di dati vastamente superiore.
La lezione dell'Harness: Non tutte le cabine di pilotaggio sono uguali
Una delle scoperte più interessanti non è stata solo che l'addestramento funzionava, ma come diversi harness influenzassero l'apprendimento. Il team ha testato i loro agenti in quattro diversi harness: ReACT (un ciclo semplice), ZeroClaw (leggero), OpenClaw e Codex (molto complesso).
Hanno scoperto che alcuni harness sono molto più difficili da imparare rispetto ad altri.
- Harness più semplici e ben allineati (come ZeroClaw) hanno permesso agli agenti di imparare più velocemente e di performare meglio.
- Harness più complessi (come Codex) sono stati più difficili da padroneggiare. Gli agenti hanno avuto più difficoltà e, sebbene il Reinforcement Learning (RL) abbia aiutato, i guadagni sono stati minori rispetto agli harness più semplici.
Ciò suggerisce che il design della "cabina di pilotaggio" conta tanto quanto l'addestramento del pilota. Un harness ben progettato rende l'agente più intelligente e affidabile.
Cosa l'RL ha effettivamente insegnato agli agenti
Gli autori hanno anche esaminato da vicino cosa hanno effettivamente imparato gli agenti quando hanno aggiunto il Reinforcement Learning (RL) sopra l'addestramento di base (SFT). Hanno scoperto che l'RL non ha solo reso gli agenti "più intelligenti" in senso generale; ha migliorato specificamente l'affidabilità:
- Autoverifica: Gli agenti hanno iniziato a controllare il proprio lavoro. Ad esempio, se creavano un file, erano più propensi a rileggerlo per assicurarsi che fosse corretto.
- Copertura degli Strumenti: Hanno iniziato a usare una varietà più ampia di strumenti invece di limitarsi a uno o due che conoscevano bene.
- Recupero dagli Errori: Questa era la parte difficile. Sebbene l'RL abbia aiutato gli agenti a recuperare da piccoli errori, il recupero dagli errori rimaneva debole. Anche dopo l'addestramento, se un agente commetteva un errore grave, spesso non riusciva a correggerlo e semplicemente si arrendeva. Gli autori suggeriscono che questa specifica abilità potrebbe richiedere dati speciali o metodi di addestramento differenti per essere padroneggiata.
Conclusione
OpenForge RL dimostra che non è necessario semplificare il mondo reale per addestrare gli agenti IA. Utilizzando un sistema basato sul cloud che separa l'addestramento dall'ambiente, è possibile addestrare gli agenti direttamente negli harness complessi e disordinati del mondo reale che utilizzeranno effettivamente.
L'articolo suggerisce che questo approccio permette ai ricercatori di costruire agenti che non sono solo più capaci, ma anche più affidabili nei loro compiti specifici. Sebbene gli agenti abbiano ancora difficoltà con il recupero da errori complessi, la capacità di addestrarli nella "vera cabina di pilotaggio" piuttosto che in un "videogioco" è un passo avanti fondamentale. Ciò significa che in futuro potremmo vedere agenti IA veramente pronti a lavorare accanto a noi, non solo in simulazioni, ma negli strumenti digitali che usiamo ogni giorno.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.