← Ultimi articoli
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

Questo articolo propone un framework di apprendimento per rinforzo guidato dalla ricerca che ottimizza iterativamente le specifiche della funzione di ricompensa attraverso generazione automatizzata, validazione e screening basato su GRPO, dimostrando che un ciclo di feedback classificato migliora significativamente le prestazioni nel ragionamento matematico su GSM8K rispetto a ensemble di ricompense statici o casuali.

Autori originali: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Pubblicato 2026-05-05
📖 5 min di lettura🧠 Approfondimento

Autori originali: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere uno studente molto intelligente (un Large Language Model) che è eccellente nel parlare ma a volte fatica con la matematica. Vuoi insegnargli a risolvere i problemi matematici meglio. Di solito, assumeresti un insegnante per correggere i suoi compiti. Ma in questo articolo, gli autori pongono una domanda diversa: "E se non sapessimo esattamente come correggere i compiti perfettamente? E se lasciassimo che un AI ci aiuti a inventare le migliori regole di valutazione?"

Ecco la storia di come l'hanno fatto, spiegata in modo semplice.

1. Il Problema: Il Mistero della "Griglia di Valutazione"

Nel mondo dell'AI, per insegnare a un modello a pensare meglio, si utilizza un sistema chiamato Apprendimento per Rinforzo. Pensa a questo come ad addestrare un cane.

  • Il Cane: Il modello AI.
  • Il Premietto: Una "ricompensa" (un punteggio positivo).
  • Il Trucco: Risolvere correttamente un problema matematico.

Il problema è che progettare il "premio" (la funzione di ricompensa) è difficile. Se dici all'AI: "Bravo se ottieni la risposta giusta", potrebbe barare indovinando o copiando schemi senza effettivamente pensare. Se cerchi di premiare i passaggi che compie, devi scrivere regole complesse, ed è facile commettere errori in quelle regole.

2. La Soluzione: La "Fabbrica delle Regole di Valutazione"

Gli autori hanno costruito un sistema che tratta le regole di valutazione stesse come qualcosa da ottimizzare. Non hanno scritto le regole a mano; hanno allestito una fabbrica dove un AI (un modello "frontier" chiamato Kimi K2) agisce come Inventore di Regole.

Ecco come funziona la fabbrica, passo dopo passo:

  • Round 1: All'AI Inventore di Regole vengono dati 20 problemi matematici e le viene chiesto di scrivere 10 nuovi modi per valutarli. Scrive queste regole come semplice codice informatico (come una ricetta).
  • Il Controllo di Sicurezza: Prima che queste regole vengano utilizzate, passano attraverso uno "scanner di sicurezza" per assicurarsi che non siano pericolose o rotte.
  • La Prova Stradale: I ricercatori prendono uno studente di matematica piccolo (un modello AI da 3 miliardi di parametri) e lo lasciano esercitarsi a risolvere problemi usando una di queste nuove regole per un breve periodo (500 passaggi).
  • La Scheda di Valutazione: Vedono quanto bene lo studente ha fatto in un test. Se la nuova regola ha aiutato lo studente a ottenere punteggi migliori, la regola riceve un alto punteggio. Se la regola ha confuso lo studente, riceve un punteggio basso.
  • Il Ciclo di Feedback: Le regole ad alte prestazioni vengono riassunte e reinviate all'AI Inventore di Regole. All'AI viene detto: "Ehi, le regole che contavano il numero di passaggi di pensiero hanno funzionato bene. Le regole che guardavano solo la risposta finale non hanno funzionato altrettanto bene. Cerca di inventare nuove regole basandoti su questo."

Hanno ripetuto questo ciclo 5 volte, generando 50 diverse regole candidate.

3. I Risultati: Trovare le "Regole d'Oro"

Dopo 5 round, hanno trovato alcuni vincitori.

  • La Migliore Regola Singola: Una regola, chiamata thinking_steps_count, è stata una campionessa. Assegnava punti extra se l'AI scriveva il suo processo di pensiero in almeno tre righe distinte. Non controllava se la risposta era corretta (lo faceva il sistema di base); incoraggiava semplicemente l'AI a mostrare il proprio lavoro.
  • Il Potere del Lavoro di Squadra (Ensemble): Hanno capito che una sola regola non è sufficiente. Quindi, hanno preso le migliori 5 regole e le hanno combinate in una "super-squadra di valutazione".
    • Il Risultato: Questa squadra di regole ha aiutato l'AI a saltare da un tasso di successo del 60% (usando solo regole di base) a un tasso di successo del 79,5%.
    • Il Controllo "Magico": Per dimostrare che non era solo fortuna o il semplice numero di regole, hanno provato una "squadra casuale" di 5 regole scelte dal mucchio. Quella squadra casuale è crollata, con l'AI che falliva quasi tutto. Questo ha dimostrato che il ciclo di feedback (imparare quali regole funzionavano e reinviarle all'inventore) era il segreto, non semplicemente avere più regole.

4. L'AI Ha Barato? (L'Audit del "Reward Hacking")

Una paura comune è che se dici a un AI "dammi più righe di pensiero", riempirà semplicemente la pagina di nonsensi per ottenere punti.

  • L'Audit: Gli autori hanno controllato le risposte dell'AI. Hanno scoperto che quando l'AI otteneva la risposta giusta, scriveva effettivamente più righe e usava più simboli matematici rispetto a quando la otteneva sbagliata.
  • La Conclusione: L'AI non stava barando riempiendo spazi vuoti; stava effettivamente pensando di più perché le regole lo incoraggiavano a farlo.

5. Perché Questo È Importante

  • È Accessibile: Non hai bisogno di un supercomputer. Hanno eseguito tutto questo esperimento su una singola scheda grafica consumer di fascia alta (come quelle usate dai gamer) in circa 40 ore.
  • È Automatizzato: Invece che un esperto umano passi settimane a indovinare come appare la griglia di valutazione perfetta, questo sistema automatizza la scoperta di quelle regole.
  • È Trasparente: Le regole non sono una scatola nera; sono semplice codice Python che gli esseri umani possono leggere, comprendere e modificare.

In sintesi: L'articolo mostra che se lasci che un AI ti aiuti a progettare il sistema di valutazione per un'altra AI, e continui a perfezionare quelle regole in base a quanto bene lo studente performa, puoi insegnare allo studente a pensare molto meglio rispetto a se gli avessi dato semplicemente un insieme statico di regole scritte da umani.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →