← Ultimi articoli
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

Il documento introduce GROW, un framework di apprendimento per rinforzo che adatta l'ottimizzazione della politica relativa di gruppo (GRPO) per agenti di modelli visione-linguaggio in ambienti aperti, decomponendo le traiettorie complete in campioni stato-azione per superare i limiti della lunghezza del contesto, ottenendo prestazioni all'avanguardia su oltre 800 compiti di Minecraft.

Autori originali: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Pubblicato 2026-05-21
📖 5 min di lettura🧠 Approfondimento

Autori originali: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a un robot a giocare a un videogioco complesso come Minecraft. Il robot ha una telecamera (i suoi occhi) e può digitare su una tastiera e muovere un mouse (le sue mani). Il suo obiettivo è completare compiti come "costruire una casa", "estrarre oro" o "sconfiggere un mostro".

Per lungo tempo, il modo migliore per insegnare a questi robot è stato il Fine-Tuning Supervisionato (SFT). Pensa a questo come mostrare al robot un video di un esperto umano che gioca perfettamente al gioco e dire: "Copia esattamente quello che hanno fatto". Il problema? Trovare ore di gameplay umano perfetto è costoso, e se il robot memorizza semplicemente il video, si confonde quando il gioco cambia leggermente.

Poi, i ricercatori hanno provato l'Apprendimento per Rinforzo (RL), in particolare un algoritmo chiamato GRPO. Questo è come lasciare che il robot giochi, fallisca, abbia successo e impari dai risultati. Tuttavia, il GRPO standard aveva un grave difetto quando applicato a giochi open-world: trattava l'intera sessione di gioco come una singola lezione.

Il Problema: La Lezione "Troppo Lunga"

Immagina di cercare di imparare a fare una torta.

  • Il GRPO standard è come darti un libro di 500 pagine che include la storia della tua infanzia, il bollettino meteo di tre giorni fa, la ricetta e la storia del cane del tuo vicino, il tutto mescolato insieme. Ti dice: "Hai fatto una buona torta alla fine, quindi tutto in questo libro di 500 pagine è stato buono".
  • Nel documento, questo è chiamato "traiettoria completa". Mentre il robot gioca a Minecraft, la storia di ciò che ha visto e fatto diventa sempre più lunga. Alla fine, il "libro" diventa così enorme e pieno di rumore irrilevante (come camminare per 10 minuti prima di trovare un blocco) che il robot si sente sopraffatto e non riesce a capire quale mossa specifica abbia effettivamente portato al successo.

La Soluzione: GROW (L'Approccio della "Scheda Ricetta")

Gli autori propongono un nuovo framework chiamato GROW (Allineamento di GRPO con la Modellazione Stato-Azione).

Invece di dare al robot l'intero libro di 500 pagine, GROW taglia la sessione di gioco in minuscole schede ricetta facili da digerire.

  • Decomposizione Stato-Azione: GROW spezza la lunga sessione di gioco in momenti individuali: "Guarda il blocco" + "Clicca il mouse" + "La piccozza colpisce".
  • Feedback Intelligente: Se il robot ha successo alla fine, GROW non dice "Tutto il gioco è stato fantastico". Invece, guarda le schede specifiche che hanno portato alla vittoria. Dice: "La mossa che hai fatto 5 secondi prima di trovare l'oro era molto buona. La mossa che hai fatto 20 minuti fa quando stavi solo camminando? Quella era solo nella media".

Come Funziona (L'Analogia)

Pensa a un allenatore che allena un calciatore.

  • Vecchio Metodo (GRPO standard): L'allenatore guarda l'intera partita di 90 minuti, vede il giocatore segnare un gol e poi urla: "Ottimo lavoro! Hai fatto tutto bene dal primo minuto all'ultimo!". Il giocatore è confuso perché in realtà ha fatto un passaggio terribile al 10° minuto che ha quasi fatto perdere la partita.
  • Metodo GROW: L'allenatore scompone la partita. "Quel passaggio al 10° minuto era disordinato. Ma la corsa che hai fatto all'80° minuto? Perfetta. E il calcio all'89° minuto? Brillante". Il giocatore impara esattamente quali azioni specifiche ripetere.

La Matematica "Magica"

Il documento include una dimostrazione matematica (Analisi Surrogata) per rassicurarci che questo approccio di "tagliare la lezione" è ancora valido.

  • La Preoccupazione: La matematica standard per questo tipo di apprendimento richiede solitamente il confronto di diversi tentativi allo stesso identico punto di partenza. GROW confronta momenti diversi nel tempo, che sono tutti diversi.
  • Il Risultato: Gli autori hanno dimostrato che anche se i punti di partenza sono diversi, il "punteggio" che il robot ottiene riflette ancora accuratamente quanto sia buona la sua strategia. È come valutare uno studente in un test di matematica: anche se le domande sono diverse, il punteggio finale ti dice ancora se sta migliorando in matematica.

I Risultati: Sconfiggere il Gioco

Il team ha testato GROW su oltre 800 diversi compiti di Minecraft, che vanno dalla navigazione nelle grotte alla creazione di oggetti e alla lotta contro i mostri.

  • Tasso di Successo: GROW ha superato significativamente i metodi precedenti. Ad esempio, nei "compiti GUI" (utilizzo dei menu del gioco per creare oggetti), il successo è passato da circa il 39% al 68%.
  • Efficienza: Il robot non ha solo vinto più spesso; ha vinto più velocemente. Ha impiegato meno passi per completare i compiti perché ha imparato a ignorare il "rumore" e a concentrarsi sulle mosse che contavano davvero.
  • Generalizzazione: Il robot non ha semplicemente memorizzato i giochi specifici su cui ha praticato. Ha imparato abilità generali (come come cercare un obiettivo o come usare un menu) che gli hanno permesso di avere successo in nuovi compiti mai visti prima che non aveva mai incontrato.

In Sintesi

GROW è un modo più intelligente per insegnare agli agenti AI a giocare a giochi open-world. Invece di sopraffarli con lunghe e disordinate storie delle loro intere sessioni di gioco, scompone il gioco in piccoli passi chiari. Questo aiuta l'AI a capire esattamente quali azioni portano al successo, permettendole di imparare più velocemente, giocare meglio e gestire nuove sfide senza confondersi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →