← Ultimi articoli
🤖 AI

Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

Il documento propone DiScO, un framework che potenzia il ragionamento dei grandi modelli linguistici definendo e ottimizzando esplicitamente diversi schemi di pensiero — comprendenti transizioni di ragionamento e candidati di risposta — attraverso un processo in tre fasi di consapevolezza degli schemi, apprendimento per rinforzo e inferenza diversificata, ottenendo prestazioni superiori nei benchmark matematici e un migliore recupero degli errori rispetto ai metodi standard.

Autori originali: Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

Pubblicato 2026-06-09
📖 5 min di lettura🧠 Approfondimento

Autori originali: Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'Idea Centrale: Non solo pensare più intensamente, ma pensare in modo diverso

Immaginate di cercare di risolvere un labirinto molto complicato. La maggior parte dei modelli di IA (Modelli di Ragionamento Large) sono come un singolo corridore che corre lungo un sentiero, sbatte contro un muro, torna indietro e prova a correre di nuovo lungo lo stesso sentiero, solo un po' più velocemente. Rimangono intrappolati in cicli o si arrendono perché sono troppo concentrati sulla loro prima idea.

Questo articolo sostiene che, per risolvere problemi complessi, l'IA non dovrebbe solo correre più velocemente; deve essere un migliore esploratore. Gli autori introducono il concetto di "Schemi di Pensiero" (Thinking Schemata). Pensate a questo come allo stile di "creazione della mappa" dell'IA.

Hanno scoperto che l'IA ottiene le migliori prestazioni quando il suo stile di creazione della mappa è diverso. Nello specifico, hanno osservato due cose:

  1. Transizioni di Ragionamento: Quanto spesso l'IA cambia idea o cambia strategia (ad esempio, "Aspetta, quel calcolo non ha funzionato, proviamo a disegnare un diagramma invece").
  2. Candidati alla Risposta: Quante diverse possibili risposte l'IA considera lungo il percorso prima di scegliere quella finale.

L'articolo afferma: Più l'IA cambia idea e prova angolazioni diverse, più è probabile che trovi la risposta corretta.


Il Problema: Il "Corridore Testardo"

Le attuali IA spesso rimangono bloccate in un binario morto. Se iniziano a risolvere un problema di matematica in un certo modo, tendono a continuare a farlo, anche se si rendono conto a metà strada di aver commesso un errore. Potrebbero dire: "Penso che la risposta sia 12", poi si rendono conto che 12 è sbagliato, ma invece di provare un approccio totalmente nuovo, modificano solo leggermente quel 12 e dicono: "Ok, forse 12.1?".

Mancano della flessibilità necessaria per dire: "Ok, ho sbagliato. Buttiamo via tutta questa idea e ricominciamo da un angolo diverso".

La Soluzione: DiScO (Ottimizzazione della Politica di Schemi Diversificati)

Gli autori hanno creato un nuovo metodo di addestramento chiamato DiScO. Potete pensare a DiScO come a un coach che insegna all'IA come essere un esploratore flessibile. Funziona in tre fasi:

1. Insegnare all'IA a "Etichettare i propri Pensieri" (SFT Consapevole degli Schemi)

Per prima cosa, l'IA viene istruita a indossare un "cappello del pensiero" che la aiuti a vedere il proprio processo di ragionamento. Impara a etichettare il proprio ragionamento con etichette speciali:

  • \AnswerCandidate: "Penso che la risposta possa essere X."
  • \ReasoningTransition: "Aspetta, sto cambiando strategia ora."

È come insegnare a uno studente a scrivere "Sono bloccato" o "Proviamo un metodo diverso" nei margini dei compiti. Questo rende l'IA consapevole di come sta pensando, non solo di cosa sta pensando.

2. Premiare il "Cambio di Idea" (RL Orientato alla Diversità)

Successivamente, l'IA gioca a un gioco dove riceve punti non solo per la risposta corretta, ma per essere diversificata.

  • Se l'IA prova tre modi diversi per risolvere il problema, riceve un bonus.
  • Se passa dal "fare calcoli" al "disegnare un diagramma", riceve un bonus.
  • Se continua a ripetere la stessa frase all'infinito, non riceve punti.

È come un coach che dice a un corridore: "Se corri solo lo stesso giro, prendi una C. Ma se provi a correre nel bosco, poi nel fiume, poi sulle colline, prendi un A+". L'IA impara che esplorare sentieri diversi è prezioso.

3. Il Trucco del "Nuovo Inizio" (Diversità al Tempo di Inferenza)

Infine, quando l'IA sta effettivamente sostenendo un esame (tempo di inferenza), il sistema ha una rete di sicurezza. Se l'IA inizia a divagare o a rimanere bloccata in un ciclo (ripetendosi), il sistema taglia l'inizio del processo di pensiero e dice: "Ok, dimentica il primo 20% di quello che hai appena detto. Ricomincia con quello che ti resta".

Questo costringe l'IA a "resettare" e guardare il problema con occhi nuovi, impedendole di rimanere intrappolata in un vicolo cieco mentale.


Cosa è Successo? (I Risultati)

I ricercatori hanno testato questo metodo su problemi matematici difficili (come quelli presenti nelle competizioni di alto livello).

  • Punteggi Migliori: L'IA addestrata con DiScO ha ottenuto punteggi significativamente più alti rispetto ai modelli di IA standard, specialmente sui problemi più difficili.
  • Migliore Recupero: Quando l'IA commetteva un errore all'inizio, il modello addestrato con DiScO era molto più bravo a rendersi conto di "Oh no, sono andato nella direzione sbagliata" e a cambiare percorso per rimediare. I modelli standard spesso continuavano a camminare lungo la strada sbagliata.
  • Più Opzioni: I modelli DiScO non si limitavano a indovinare una risposta; esploravano molti diversi "Candidati alla Risposta" prima di stabilizzarsi sulla risposta corretta.

Conclusione

L'articolo conclude che la diversità è la chiave. Proprio come un essere umano che risolve un puzzle difficile trae beneficio dal provare diverse strategie, cambiare prospettiva e non attaccarsi alla prima idea, anche i modelli di IA ottengono prestazioni migliori quando vengono incoraggiati a pensare in modi vari e flessibili.

Gli autori suggeriscono che il futuro del ragionamento dell'IA non riguarda solo il rendere i modelli più grandi o più veloci, ma il renderli pensatori più diversificati.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →