← Ultimi articoli
🤖 machine learning

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

Questo articolo introduce AIRL-S, un framework unificato che combina l'Adversarial Inverse Reinforcement Learning con il Group Relative Policy Optimization per inferire ricompense dense e passo dopo passo da traiettorie di riferimento, eliminando così la necessità di dati di processo etichettati e consentendo al contempo uno scaling del tempo di test robusto ed economico che raggiunge prestazioni di livello GPT-4o attraverso benchmark di matematica, scienza e generazione di codice.

Autori originali: Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

Pubblicato 2026-08-27
📖 6 min di lettura🧠 Approfondimento

Autori originali: Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I modelli linguistici di grandi dimensioni sono i potenti motori dietro molti sistemi di intelligenza artificiale moderna, capaci di generare testo, risolvere problemi e scrivere codice. Per anni, i ricercatori hanno cercato di rendere questi sistemi più intelligenti insegnando loro a pensare ai problemi passo dopo passo, un metodo noto come "catena di pensiero" (chain of thought). Tuttavia, insegnare a un modello di ragionare bene è difficile perché il computer spesso sa solo se la risposta finale è giusta o sbagliata, non se i passaggi che portano ad essa siano logici. Per risolvere questo problema, gli scienziati hanno provato due approcci principali. Uno prevede l'addestramento del modello con ricompense solo alla fine di un compito, il che può essere instabile ed inefficiente. L'altro utilizza una guida separata per controllare ogni singolo passaggio del processo di ragionamento, ma la creazione di questa guida richiede solitamente esperti umani costosi per etichettare migliaia di esempi, e la guida spesso fallisce quando il modello inizia a pensare in modi nuovi.

Un team di ricercatori ha introdotto un nuovo sistema chiamato AIRL-S che unifica questi due approcci in un unico ciclo di auto-miglioramento. Invece di fare affidamento su etichette umane per ogni passaggio, il sistema impara a creare la propria guida interna osservando esempi di ragionamento di alta qualità. Utilizza poi questa guida sia per addestrare il modello, sia per aiutare la ricerca delle migliori risposte durante l'uso nel mondo reale. Nei test condotti su otto benchmark riguardanti matematica, scienza e programmazione, i ricercatori hanno scoperto che questo metodo ha migliorato le prestazioni del modello di una media del nove per cento rispetto alla sua versione iniziale. Il sistema risultante ha ottenuto prestazioni paragonabili a quelle dei più avanzati modelli commerciali disponibili, come GPT-4o, senza richiedere la costosa supervisione umana richiesta dai metodi precedenti.

L'innovazione principale risiede nel modo in cui il sistema impara a giudicare il proprio lavoro. Tradizionalmente, per insegnare a un modello di ragionare passo dopo passo, i ricercatori avrebbero bisogno di un "modello di ricompensa di processo" (process reward model), ovvero un programma separato addestrato su dati in cui gli esseri umani hanno contrassegnato ogni passaggio corretto o errato. Questo è un processo lento e costoso. Il nuovo metodo aggira questo problema utilizzando una tecnica chiamata apprendimento avversario. Immaginate il sistema che gioca a un gioco in cui una parte cerca di generare passaggi di ragionamento e un'altra parte cerca di distinguere tra tali passaggi generati e un insieme di esempi di riferimento di alta qualità. Attraverso questa competizione, il sistema impara a riconoscere cosa costituisce un buon passaggio di ragionamento senza mai essere istruito esplicitamente da un essere umano. Questa guida appresa, o modello di ricompensa, diventa densa e dettagliata, offrendo un feedback su ogni singolo passaggio del processo di ragionamento anziché solo sul risultato finale.

Una volta che il sistema ha appreso questa guida interna, la utilizza in due modi simultaneamente. Primo, utilizza la guida per addestrare il modello principale, incoraggiandolo a compiere passi migliori durante la fase di apprendimento. Secondo, mantiene la stessa guida per agire come verificatore durante la fase di risoluzione dei problemi. Quando al modello viene chiesto di risolvere un problema difficile, esso può generare molte diverse soluzioni possibili. La guida appresa assegna quindi un punteggio a ogni passaggio di queste potenziali soluzioni, aiutando il sistema a selezionare il percorso più logico. Ciò crea una pipeline unificata in cui lo strumento utilizzato per insegnare al modello è lo stesso strumento utilizzato per aiutarlo a pensare durante un test. I ricercatori hanno dimostto che questa guida è robusta; funziona efficacemente anche quando applicata a modelli diversi o a diverse strategie di ricerca, suggerendo che la conoscenza appresa è generale e trasferibile.

I risultati di questo approccio sono stati misurati attraverso una vasta gamma di compiti impegnativi. I ricercatori hanno testato il loro modello su otto benchmark standard, inclusi complessi concorsi di matematica, domande di ragionamento scientifico e sfide di programmazione. Il modello, che partiva come un normale modello linguistico open-source, ha migliorato la sua accuratezza media del nove per cento dopo l'addestramento con questo nuovo metodo. In compiti specifici di matematica e scienza, il miglioramento è stato ancora più alto, raggiungendo il tredici per cento. Rispetto ad altri modelli che erano stati addestrati con costose etichette umane o altre tecniche avanzate di apprendimento per rinforzo, questo nuovo sistema ha costantemente ottenuto prestazioni migliori. Ha persino eguagliato le prestazioni di GPT-4o, un modello commerciale di alto livello, nonostante avesse significativamente meno parametri. Ciò suggerisce che la qualità del processo di ragionamento, guidata da questo sistema di ricompensa auto-appreso, è più importante del semplice fatto di avere un modello più grande.

Una scoperta chiave dello studio è come i due diversi tipi di segnali di apprendimento lavorino insieme. Il sistema combina il feedback dettagliato, passo dopo passo, della sua guida auto-appresa con le ricompense del risultato finale dei metodi tradizionali. I ricercatori hanno scoperto che fare affidamento su un solo tipo di segnale era meno efficace. La guida passo dopo passo ha aiutato il modello a esplorare migliori percorsi di ragionamento, mentre il segnale del risultato finale ha garantito che il modello rimanesse concentrato sull'ottenere la risposta corretta. Quando bilanciati correttamente, questi due segnali si sono rinforzati a vicenda, portando a un addestramento più stabile e a risultati migliori. Inoltre, il sistema ha dimostrato di poter utilizzare questa guida appresa per migliorare varie metodologie di ricerca, come quelle che provano molte soluzioni diverse contemporaneamente o quelle che costruiscono un albero di possibilità. La guida è stata particolarmente efficace in scenari di ricerca complessi in cui il modello doveva valutare il valore dei passaggi intermedi per compiere la scelta migliore.

Le implicazioni di questo lavoro vanno oltre il semplice ottenimento di punteggi più alti nei test. Eliminando la dipendenza dalle costose annotazioni umane per il ragionamento passo dopo passo, questo metodo offre un modo più scalabile ed economico per migliorare l'intelligenza artificiale. Suggerisce che i modelli possono imparare a essere i propri insegnanti, perfezionando le proprie capacità di ragionamento osservando esempi di alta qualità e competendo contro se stessi. I ricercatori hanno osservato che il loro approccio è particolarmente adatto per compiti in cui la risposta finale può essere verificata automaticamente, come la matematica e la programmazione. Sebbene il metodo sia potente, gli autori riconoscono che attualmente si basa su questi esiti verificabili e potrebbe richiedere ulteriori sviluppi per gestire compiti aperti in cui non esiste una singola risposta corretta. Tuttavia, la capacità di unificare l'addestramento e la ricerca durante l'inferenza in un unico sistema efficiente segna un passo avanti significativo nel rendere i modelli linguistici di grandi dimensioni dei ragionatori più affidabili e capaci.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →