SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
Il documento introduce SRPO (Setwise Relative Policy Optimization), un nuovo framework di apprendimento per rinforzo per modelli linguistici di grandi dimensioni multi-agente che unifica la divisione del lavoro e la co-evoluzione congiunta trattando l'insieme minimo di output consumati in una singola transizione di stato come un'azione unificata, abilitando così un addestramento stabile ed efficace attraverso diversi workflow e scale di modello.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo in rapida evoluzione dell'intelligenza artificiale, i grandi modelli linguistici hanno imparato ad agire come agenti, capaci di ragionare, cercare informazioni e utilizzare strumenti per risolvere problemi complessi. Quando questi modelli lavorano da soli, seguono un singolo percorso di pensiero. Tuttavia, per affrontare sfide più difficili, i ricercatori spesso impiegano più agenti che collaborano, proprio come una squadra di specialisti. A volte, queste squadre dividono un compito in modo che ogni membro si occupi di un ruolo specifico, mentre altre volte generano diverse idee simultaneamente per perfezionare insieme una soluzione. La difficoltà centrale nel addestrare tali squadre è stata capire come premiarle. I metodi tradizionali spesso trattano l'output di ogni agente come un evento separato, anche quando diversi agenti lavorano insieme per produrre un singolo risultato. Ciò crea un disallineamento: il sistema impara dai singoli pezzi del puzzle piuttosto che dall'immagine completa che formano insieme, rendendo difficile addestrare squadre che passano dal lavorare da sole al lavorare congiuntamente.
Un team di ricercatori ha affrontato questo disallineamento proponendo un nuovo metodo di addestramento chiamato Setwise Relative Policy Optimization, o SRPO. Invece di guardare le risposte individuali, questo approccio tratta l'intero gruppo di output che causano un cambiamento nell'ambiente come un'unica unità di azione. Immaginate una squadra di esploratori che raggiunge un bivio lungo la strada; che sia una sola persona a scegliere un sentiero, o che l'intero gruppo discuta e poi scelga una rotta insieme, la decisione che li fa avanzare è il risultato collettivo. I ricercatori hanno scoperto che, raggruppando questi output in quello che chiamano un "active set" (insieme attivo), potevano addestrare il sistema a comprendere che lo sforzo congiunto della squadra è la vera azione. Questo metodo permette alle stesse regole di addestramento di applicarsi sia quando la squadra lavora in una rigida divisione del lavoro, dove una persona fa una cosa, sia in una modalità di co-evoluzione congiunta, dove più persone contribuiscono a un'idea condivisa contemporaneamente.
I ricercatori hanno testato questa idea su due tipi di compiti molto diversi: risolvere problemi matematici difficili e condurre ricerche multi-turno per trovare fatti specifici. Negoli esperimenti matematici, il sistema doveva generare soluzioni candidate e poi verificarle, un processo che talvolta richiedeva che un agente risolvesse e un altro controllasse, e altre volte richiedeva che diversi agenti proponessero diverse derivazioni contemporaneamente. Negli esperimenti di ricerca, il sistema doveva decidere quando chiedere ulteriori informazioni, con più agenti che potenzialmente emettevano query di ricerca simultaneamente prima che un aggregatore combinasse i risultati. Attraverso quattro diverse dimensioni di modelli linguistici, il nuovo metodo ha superato costantemente gli approcci esistenti. Nei benchmark matematici, il sistema ha raggiunto un'accuratezza media in cui circa il 61 o 62 percento delle sue soluzioni generate erano corrette, e ha trovato almeno una risposta corretta per circa il 78 percento dei problemi. Nei compiti di ricerca, il miglioramento è stato ancora più pronunciato, con il nuovo metodo che trovava risposte corrette per oltre il 60 percento delle query in media, un salto significativo rispetto ai metodi precedenti.
Una parte fondamentale della scoperta è stata capire come bilanciare i contributi di più agenti. Se il sistema avesse semplicemente sommato i cambiamenti apportati da ogni agente, una squadra più numerosa sarebbe apparsa avere un impatto molto maggiore rispetto a una più piccola, semplicemente perché c'erano più voci. I ricercatori hanno risolto questo problema normalizzando il contributo del gruppo, assicurando che una squadra di cinque agenti non fosse penalizzata rispetto a un singolo agente solo a causa della sua dimensione. Hanno anche dimostrato che il sistema poteva imparare a passare tra queste modalità in modo dinamico. In alcuni casi, il sistema ha imparato che un singolo agente specializzato era la scelta migliore, mentre in altri, ha attivato un piccolo gruppo di agenti per lavorare insieme. Questa flessibilità significava che il processo di addestramento non aveva bisogno di essere riscritto per diversi tipi di struttura della squadra; la stessa logica sottostante gestiva entrambi gli scenari senza problemi.
Lo studio ha anche esaminato da vicino il costo di questi miglioramenti. I ricercatori sono stati attenti a garantire che i risultati migliori non fossero semplicemente dovuti al fatto che il nuovo metodo generava più testo o utilizzava più potenza di calcolo. Hanno misurato il numero di token generati e il numero di chiamate agli strumenti, scoprendo che i miglioramenti derivavano da una migliore coordinazione piuttosto che dalla forza bruta. In effetti, il processo di addestramento ha spesso portato a risposte più brevi ed efficienti nel tempo. I ricercatori hanno osservato che, sebbene i risultati fossero solidi, si basavano su benchmark specifici e confronti con altri metodi pubblicati, e che il lavoro futuro dovrà esplorare come questi guadagni si mantengano in implementazioni reali a lungo termine. Ciononostante, il nucleo della scoperta rimane: definendo l'output collettivo della squadra come l'unità fondamentale di azione, è possibile addestrare sistemi multi-agente che siano più stabili, efficienti ed efficaci nel risolvere problemi complessi, indipendentemente dal fatto che stiano lavorando da soli o insieme.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.