Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
Questo articolo introduce un nuovo metodo di post-addestramento per modelli linguistici di grandi dimensioni che potenzia l'ottimizzazione della politica relativa di gruppo (GRPO) mediando i logit di una politica di riferimento SFT congelata e di una politica addestrabile, eliminando così la necessità di regolarizzazione KL o di un critico, mentre combina efficacemente le capacità di ragionamento del RL con la stabilità di formattazione dell'SFT.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il Quadro Generale: Due Insegnanti, Uno Studente
Immagina di addestrare un grande modello linguistico (un'IA) a risolvere problemi di matematica. Hai due "insegnanti" distinti che cercano di insegnargli:
- L'Insegnante della Formattazione (SFT): Questo insegnante è eccellente nell'insegnare all'IA come scrivere le risposte in modo ordinato, utilizzare i simboli corretti e seguire regole rigorose (come incorniciare la risposta finale). Tuttavia, questo insegnante a volte commette errori nella logica matematica effettiva.
- L'Insegnante del Ragionamento (RL): Questo insegnante è un genio della matematica che può risolvere equazioni complesse perfettamente. Ma è disordinato; spesso dimentica di incorniciare la risposta, salta passaggi o scrive in un formato strano che non corrisponde a quanto richiesto dall'esame.
Il Problema:
Tradizionalmente, quando cerchi di combinare questi due, usi un metodo chiamato "Regolarizzazione KL". Immagina questo come un elastico che lega l'Insegnante del Ragionamento all'Insegnante della Formattazione. L'elastico costringe l'Insegnante del Ragionamento a rimanere vicino allo stile dell'Insegnante della Formattazione.
- Il Difetto: Se l'Insegnante della Formattazione commette un errore matematico, l'elastico trascina l'Insegnante del Ragionamento nello stesso errore. L'IA rimane intrappolata cercando di essere "ordinata" ma fallisce nell'essere "intelligente".
La Nuova Soluzione: Mediazione dei Logit
Gli autori di questo documento propongono un nuovo modo per combinare questi insegnanti. Invece di legarli insieme con un elastico, creano una Voce Fusa.
Immagina che l'IA sia un coro. Invece di costringere i cantanti a rimanere in perfetto unisono (il che limita il loro registro), il nuovo metodo mescola le loro voci prima che cantino.
- Se l'Insegnante della Formattazione dice: "Incornicia la risposta", e l'Insegnante del Ragionamento dice: "La risposta è 5", la Voce Fusa dice: "Incornicia la risposta: 5".
- Se l'Insegnante della Formattazione commette un errore matematico (dicendo che la risposta è 6), ma l'Insegnante del Ragionamento sa che è 5, la Voce Fusa si affida pesantemente alla matematica dell'Insegnante del Ragionamento mantenendo l'istruzione dell'Insegnante della Formattazione di "incorniciarla".
Come Funziona (La Magia dei "Logit")
In termini di IA, la "voce" del modello è composta da numeri chiamati logit (che rappresentano quanto è probabile che il modello scelga una specifica parola o numero successivamente).
- La Miscela: I ricercatori prendono i numeri dall'Insegnante della Formattazione e dall'Insegnante del Ragionamento e li mediando matematicamente.
- Il Risultato: Questo crea una nuova "Politica Fusa" temporanea.
- L'Addestramento: L'IA impara praticando su questa Politica Fusa. Riceve una ricompensa (punti) se la risposta finale è corretta.
- Poiché l'Insegnante della Formattazione fa parte della miscela, l'IA non dimentica mai come scrivere in modo ordinato.
- Poiché l'Insegnante del Ragionamento fa parte della miscela, l'IA è libera di correggere gli errori matematici dell'Insegnante della Formattazione.
Perché Questo È Meglio (Il "Prodotto di Esperti")
Il documento utilizza un concetto chiamato "Prodotto di Esperti". Immaginalo come una decisione di comitato:
- Se Esperto A (Formattazione) è sicuro dello stile, e Esperto B (Ragionamento) è sicuro della matematica, la decisione finale è forte in entrambi gli aspetti.
- Se l'Esperto A è sbagliato sulla matematica, la fiducia dell'Esperto B la sovrascrive, ma la fiducia dell'Esperto A sullo stile rimane.
Il documento ha scoperto che questo approccio della "Voce Fusa" funziona meglio del vecchio metodo dell'"elastico". L'IA ha imparato a risolvere i problemi di matematica correttamente e ha mantenuto la sua formattazione ordinata, mentre il vecchio metodo spesso faceva dimenticare all'IA come formattare correttamente o la faceva rimanere intrappolata negli errori matematici dell'Insegnante della Formattazione.
Gli Esperimenti
I ricercatori hanno testato questo su tre diversi "esami" (dataset):
- MATH: Problemi di matematica difficili.
- cn-k12: Matematica delle scuole medie e superiori cinesi.
- MMLU: Conoscenza generale e ragionamento.
Hanno testato su tre diverse dimensioni di modelli di IA (piccolo, medio e grande).
I Risultati:
- In quasi tutti i casi, il nuovo metodo della "Voce Fusa" ha ottenuto punteggi più alti rispetto al metodo tradizionale.
- È stato particolarmente efficace nel risolvere un problema specifico: il metodo tradizionale spesso faceva "dimenticare" all'IA come formattare le risposte mentre imparava a risolvere matematica più difficile. Il nuovo metodo ha mantenuto intatte le abilità di formattazione mentre migliorava le abilità matematiche.
Un Esempio Concreto dal Documento
Il documento fornisce un esempio specifico di un problema di geometria:
- L'Insegnante della Formattazione (SFT): Imposta correttamente l'equazione ma commette un errore matematico, concludendo che il raggio è 6. Incornicia la risposta in modo ordinato.
- L'Insegnante del Ragionamento (RL): Calcola correttamente la matematica, trovando che il raggio è 5, ma dimentica di incorniciare la risposta o di scriverla nel formato finale.
- La Voce Fusa: Prende la matematica corretta (5) dall'Insegnante del Ragionamento e l'istruzione ordinata di incorniciare dall'Insegnante della Formattazione. L'output finale è un 5 ordinatamente incorniciato.
Riepilogo
Il documento introduce un modo per addestrare modelli di IA che agisce come un team collaborativo piuttosto che una rigida gerarchia. Mediando matematicamente i "pensieri" (logit) di un insegnante ordinato ma disordinato e di un insegnante intelligente ma disordinato, l'IA impara a essere sia intelligente che ordinata, evitando le insidie di costringere uno a seguire rigorosamente l'altro.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.