← Ultimi articoli
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

Questo articolo identifica il "collasso dell'esplorazione" come una modalità di fallimento chiave in cui gli agenti LLM perdono la capacità di scoprire nuove soluzioni in ambienti sconosciuti durante l'apprendimento per rinforzo, e propone SPA, un metodo che migliora le prestazioni radicando prima l'agente nella predizione dello stato e della transizione tramite il fine-tuning supervisionato basato sulla propria esperienza prima di ottimizzare per la ricompensa.

Autori originali: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Pubblicato 2026-09-10
📖 5 min di lettura🧠 Approfondimento

Autori originali: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un programma per computer progettato per pensare e agire come un essere umano, capace di risolvere enigmi, navigare in mondi virtuali o persino usare un browser web per trovare informazioni. Questi programmi, noti come grandi modelli linguistici, sono addestrati su enormi quantità di testo provenienti da Internet, imparando a prevedere quale parola verrà dopo in una frase. Quando i ricercatori chiedono a questi modelli di agire come agenti — ovvero di compiere dei passi per raggiungere un obiettivo — spesso utilizzano un metodo chiamato apprendimento per rinforzo. Questo è un processo in cui il modello prova diverse azioni, riceve un feedback sul fatto che abbia avuto successo o meno, e impara gradualmente a ripetere le azioni che portano al successo. È un modo potente per insegnare a una macchina come fare cose per cui non è stata esplicitamente programmata. Tuttavia, un problema critico sorge quando questi agenti vengono inseriti in situazioni nuove e sconosciute. Sebbene possano imparare a risolvere un enigma specifico che hanno già visto, spesso faticano a capire come esplorare un ambiente completamente nuovo, rimanendo intrappolati in un modo di pensare ristretto che impedisce loro di trovare la soluzione migliore.

Un team di ricercatori si è posto l'obiettivo di capire perché questi agenti intelligenti falliscono quando incontrano l'ignoto. Hanno scoperto un fenomeno specifico che chiamano "collasso dell'esplorazione". In termini semplici, quando un agente viene addestrato su un nuovo compito, spesso impara a trovare solo un percorso specifico verso il successo e poi ignora tutte le altre possibilità. Diventa così concentrato su quel singolo percorso da perdere la capacità di provare approcci diversi. I ricercatori hanno misurato questo fenomeno osservando due punteggi differenti: uno che traccia se la sua migliore ipotesi funziona, e un altro che traccia se una qualsiasi delle sue molteplici ipotesi funziona. Nei compiti familiari, entrambi i punteggi migliorano man mano che l'agente apprende. Ma in ambienti nuovi e difficili, come un puzzle basato su una griglia dove bisogna spingere delle scatole verso obiettivi specifici, il punteggio della singola ipotesi migliore aumenta leggermente, mentre il punteggio del tentativo di percorrere molti sentieri diversi diminuisce. L'agente sta imparando a essere più sicuro di una cattiva abitudine piuttosto che imparare a essere più flessibile. Questo accade perché l'agente non comprende veramente le regole del nuovo mondo in cui si trova; sta tirando a indovinare senza una solida base.

Per risolvere questo problema, i ricercatori hanno sviluppato un nuovo metodo di addestramento chiamato SPA, che sta per Self-Experience Agent (Agente di Esperienza Propria). Invece di cercare immediatamente di insegnare all'agente come ottenere ricompense, hanno prima insegnato all'agente come comprendere il mondo che lo circonda. Hanno dato all'agente la possibilità di esplorare l'ambiente da solo, senza la pressione di ottenere punti. Durante questa fase, l'agente è stato chiamato a descrivere ciò che vedeva e a prevedere cosa sarebbe successo dopo se avesse compiuto una determinata azione. Per esempio, se l'agente vedeva una scatola in una posizione specifica e decideva di spingerla, doveva prima dichiarare dove si trovasse la scatola e poi prevedere dove sarebbe finita. I ricercatori hanno poi utilizzato gli esiti reali e corretti dall'ambiente per correggere le previsioni dell'agente, insegnandogli efficacementamente le leggi della fisica per quel gioco specifico. Questo processo ha creato una sorta di mappa interna o "modello del mondo" nella mente dell'agente, radicando la sua comprensione nella realtà anziché in vaghe supposizioni.

Una volta che l'agente aveva costruito questa comprensione interna di come funziona il mondo, i ricercatori hanno iniziato il processo di addestramento standard per insegnargli come vincere. I risultati sono stati sorprendenti. Nei test su un gioco di puzzle chiamato Sokoban, dove l'agente doveva spingere scatole verso degli obiettivi, il metodo di addestramento standard ha permesso all'agente di avere successo solo circa il 25 percento delle volte. Con il nuovo metodo, il tasso di successo è balzato a quasi il 60 percento. In un altro puzzle che coinvolgeva un lago ghiacciato, il tasso di successo è migliorato da circa il 22 percento a oltre il 70 percento. Forse ancora più sorprendente, un modello informatico molto piccolo addestrato con questo metodo è stato in grado di superare un modello molto più grande e potente che era stato addestrato utilizzando il vecchio metodo standard. Il modello piccolo, avendo imparato prima le regole del gioco, è stato in grado di navigare i complessi puzzle in modo più efficace rispetto al modello gigante che aveva solo cercato di indovinare il modo per ottenere una ricompensa.

I ricercatori hanno anche testato se questo approccio funzionasse su altri tipi di compiti, come un puzzle logico chiamato Sudoku e un ambiente simulato per faccende domestiche. In ogni caso, il metodo che insegnava all'agente a comprendere lo stato del mondo prima di cercare di vincere portava a risultati migliori. Hanno scoperto che la chiave del successo non era solo avere più dati o un computer più grande, ma piuttosto l'ordine in cui avveniva l'apprendimento. Costringendo l'agente a imparare prima la struttura dell'ambiente, esso evitava la trappola del collasso in una singola strategia fragile. L'agente ha imparato a mantenere aperte le proprie opzioni, esplorando molteplici percorsi perché comprendeva le conseguenze delle proprie azioni. Questo approccio suggerisce che, affinché l'intelligenza artificiale possa davvero adattarsi a situazioni nuove e complesse, deve costruire una comprensione affidabile della realtà prima di cercare di ottimizzare il successo. Lo studio dimostra che quando un agente è radicato nella meccanica reale del proprio ambiente, può imparare a esplorare in modo più efficace e a risolvere problemi che prima erano fuori portata.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →