← Ultimi articoli
🤖 AI

MASPRM: Multi-Agent System Process Reward Model

Il documento introduce MASPRM, un modello di ricompensa di processo multi-agente addestrato su esiti terminali per valutare i messaggi intermedi degli agenti, il quale migliora significativamente le prestazioni di ricerca durante l'inferenza sui benchmark di ragionamento rispetto ai modelli esistenti, abilitando una ricerca beam search e una ricerca Monte Carlo Tree Search a livello di step più efficaci.

Autori originali: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

Pubblicato 2026-07-16
📖 6 min di lettura🧠 Approfondimento

Autori originali: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di risolvere un puzzle davvero difficile, come un problema matematico complesso o un indovinello logico. Nel mondo dell'intelligenza artificiale, abbiamo i "Large Language Models" (LLM) che sono come studenti super intelligenti, ma a volte distratti. Se poni loro una domanda difficile, potrebbero provare a rispondere tutto in un colpo solo, ma spesso si bloccano o commettono un errore all'inizio e continuano a percorrere la strada sbagliata. Per risolvere questo problema, gli scienziati hanno iniziato a utilizzare i "Sistemi Multi-Agente". Pensa a questo non come a uno studente che lavora da solo, ma a un gruppo di studio. Hai un "Lettore" che legge la domanda, un "Pianificatore" che crea una strategia, un "Risolutore" che fa i calcoli e un "Verificatore" che controlla il lavoro. Si scambiano appunti seguendo un ordine specifico.

Tuttavia, c'è un problema. Se lasci che questo gruppo di studio faccia ciò che vuole, potrebbero sprecare molto tempo ed energia (potenza di calcolo) discutendo di idee che sono già sbagliate. È come un gruppo di amici che cerca di risolvere un mistero, ma continuano a inseguire un falso indizio perché nessuno si è fermato a dire: "Aspetta, questo indizio non ha senso". Per evitare questo spreco, i ricercatori utilizzano "algoritmi di ricerca" come il Monte Carlo Tree Search (MCTS). Questo è come un allenatore che dice: "Proviamo cinque percorsi diversi per il prossimo passo, vediamo quale sembra più promettente e poi concentriamoci su quello". Ma ecco il grosso problema: come fa l'allenatore a sapere quale percorso è promettente? Di solito, l'allenatore sa solo se la risposta finale è giusta o sbagliata. Non sa se i passaggi intermedi sono stati buoni. Questo articolo introduce un nuovo strumento per aiutare l'allenatore a prendere decisioni migliori proprio nel mezzo del gioco.

Il Paper: MASPRM

I ricercatori dietro questo articolo, provenienti dall'Università della British Columbia e da Huawei, stanno affrontando esattamente questo problema. Hanno creato qualcosa chiamato MASPRM (Multi-Agent System Process Reward Model). Puoi pensare a MASPRM come a un "Super Allenatore" o a un "Giudice di Processo" che non si limita ad aspettare la risposta finale per vedere se il gruppo ha avuto successo. Invece, osserva la conversazione del gruppo di studio mentre avviene e valuta ogni singolo appunto che si scambiano.

In passato, se un team di IA commetteva un errore al passaggio 3, il sistema non lo sapeva fino alla fine, quando la risposta finale era errata. A quel punto, l'IA aveva già sprecato un sacco di energia esplorando quel percorso errato. MASPRM cambia le regole del gioco. Esamina la "trascrizione instradata" — che è solo un modo elegante per dire l'elenco ordinato dei messaggi che gli agenti si sono inviati — e valuta questi messaggi per dire: "Ehi, questo specifico messaggio del Pianificatore è stata un'ottima idea, continuiamo così", oppure "Questo messaggio del Risolutore non ci sta portando da nessuna parte, tagliamo subito questo ramo".

Come hanno istruito l'Allenatore

Una delle parti più interessanti di questo articolo è come hanno addestrato questo Super Allenatore. Di solito, per insegnare a un computer a giudicare i passaggi, è necessario che un essere umano sieda lì e cataloghi ogni singolo passaggio come "buono" o "cattivo". Questo è incredibilmente costoso e lento. Gli autori hanno trovato una scorciatoia intelligente. Hanno lasciato che gli agenti IA eseguissero migliaia di simulazioni utilizzando un metodo di ricerca chiamato MCTS. In queste simulazioni, gli agenti esploravano molti percorsi diversi. Alla fine di ogni percorso, sapevano se la risposta era giusta (+1) o sbagliata (-1).

Poi, hanno utilizzato un trucco matematico chiamato "backpropagation". Immagina un albero dove le foglie sono i risultati finali. Se una foglia è una "vittoria", il valore di questa vittoria risale lungo i rami, facendo apparire i passaggi precedenti come preziosi. Se una foglia è una "sconfitta", il valore risale come un valore negativo. MASPRM ha imparato a prevedere questi valori semplicemente guardando la cronologia della conversazione, senza che un solo essere umano dovesse dire: "Questo passaggio era buono". Ha imparato a distinguere tra una conversazione promettente e una discussione senza uscita semplicemente vedendo quali di esse portavano infine alla risposta corretta.

Cosa hanno scoperto

Il team ha testato questo nuovo allenatore su quattro benchmark famosi: GSM8K e MATH (per problemi matematici) e MMLU e LOGIQA (per cultura generale e logica). Hanno confrontato MASPRM con altri due metodi:

  1. Policy Likelihood: Questo è come se l'IA stesse solo indovinando: "Penso che questa prossima parola sia probabile", senza una reale comprensione dell'obiettivo.
  2. ORM (Outcome Reward Model): Questo è il vecchio modello di allenatore che controlla solo la risposta finale, ignorando i passaggi intermedi.

I risultati sono stati molto chiari. Quando i ricercatori hanno usato MASPRM per guidare la ricerca (specificamente usando MCTS e un metodo chiamato Step-Level Beam Search), l'IA è diventata significativamente più brava a risolvere i problemi.

  • Sul modello da 1,5 miliardi di parametri (un'IA più piccola e veloce), MASPRM ha migliorato il tasso di successo di 2,0 - 3,0 punti rispetto al vecchio Outcome Reward Model.
  • Sul modello da 7 miliardi di parametri (un'IA più grande e intelligente), il miglioramento è stato massiccio, con un salto di 4,1 - 14,5 punti.
  • Nel test più difficile (GSM8K), la combinazione del modello 7B e MASPRM ha raggiunto un Hit@1 dell'82,9%, il che significa che otteneva la risposta corretta al primo tentativo quasi l'83% delle volte.

L'articolo suggerisce che MASPRM è particolarmente efficace nella "ricerca per passi" (stepwise search). Questo accade quando l'IA deve prendere una serie di decisioni, come scegliere quale agente parla dopo o quale debba essere la frase successiva. Poiché MASPRM può giudicare questi passaggi intermedi, impedisce all'IA di sprecare tempo su cattive idee. Ha anche reso le scelte dell'IA più affidabili; il divario tra la scelta "migliore" e la "quinta migliore" si è ridotto, il che significa che l'IA era più sicura nelle sue prime scelte.

I Limiti e il Futuro

Gli autori sottolineano che questo non è un bacchetta magica che risolve tutto. Il loro sistema funziona meglio quando gli agenti hanno un programma fisso (come un ordine rigoroso su chi parla quando) e quando la risposta finale può essere chiaramente verificata (come un problema matematico con un numero specifico). Ammettono che per compiti aperti dove non esiste un'unica risposta "corretta", o per sistemi in cui gli agenti cambiano i loro ruoli dinamicamente, questo metodo è ancora in fase di studio. Hanno anche scoperto che se l'allenatore vede solo ciò che vede un singolo agente (invece dell'intera conversazione del gruppo), non funziona altrettanto bene, suggerendo che avere una "visione globale" della chat del team è fondamentale per ottenere le migliori prestazioni.

In breve, MASPRM è una svolta nel modo in cui insegna ai team di IA come autocorreggersi in tempo reale. Invece di aspettare la fine per rendersi conto di aver sbagliato, ora hanno un allenatore che può individuare un percorso errato precocemente e riportare il team sulla strada giusta, risparmiando tempo e ottenendo risultati migliori. Suggerisce che per compiti di ragionamento complesso, il segreto non è solo avere un cervello più grande, ma avere un modo migliore per guidare il processo di pensiero mentre avviene.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →