Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
Questo articolo indaga se LLaMA 2 e Flan-T5 esibiscano un vero ragionamento transitivo o si affidino a indizi superficiali controllando le sovrapposizioni lessicali, la conoscenza pre-addestrata e le entità nominate, rivelando che, sebbene entrambi i modelli sfruttino le sovrapposizioni lessicali, Flan-T5 dimostra una maggiore resilienza alle manipolazioni basate sulla conoscenza, suggerendo un potenziale ruolo del fine-tuning nello sviluppo della comprensione logica.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel campo in rapida evoluzione dell'intelligenza artificiale, un tipo specifico di programma informatico noto come Modello di Linguaggio di Grandi Dimensioni ha catturato l'attenzione del mondo. Questi sistemi, addestrati su enormi quantità di testo provenienti da internet, possono scrivere storie, tradurre lingue e rispondere a domande complesse. Una domanda centrale per gli scienziati che studiano queste macchine è se comprendano davvero la logica o se stiano semplicemente imitando i modelli che hanno visto in precedenza. Per testare questo aspetto, i ricercatori osservano una capacità fondamentale chiamata ragionamento transitivo. In termini quotidiani, questa è la capacità di collegare due pezzi separati di informazione per raggiungere una nuova conclusione. Per esempio, se una persona sa che un gatto è un tipo di animale, e che tutti gli animali hanno bisogno di cibo, può dedurre logicamente che un gatto ha bisogno di cibo senza che le venga esplicitamente detto questo specifico fatto. Questo processo richiede più della semplice memoria; richiede la capacità di intrecciare i fatti tra loro. La domanda che guida la ricerca recente è se questi potenti programmi informatici stiano effettivamente compiendo questo intreccio mentale, o se stiano prendendo una scorciatoia individuando parole familiari e indovinando la risposta.
Un team di ricercatori della Heriot-Watt University e della University of Edinburgh si è posto l'obiettivo di indagare proprio su questo problema. Si sono concentrati su due tipi distinti di modelli linguistici, uno chiamato LLaMA 2 e un altro chiamato Flan-T5, per vedere come gestivano domande che richiedevano di collegare due fatti. Gli scienziati hanno utilizzato due collezioni esistenti di domande progettate per testare questo tipo di pensiero. Una collezione, nota come QASC, presenta domande a scelta multipla sulla scienza che richiedono di combinare due affermazioni per trovare la risposta corretta. L'altra collezione, chiamata Bamboogle, contiene domande abbastanza difficili che un normale motore di ricerca su internet potrebbe sbagliare, costringendo il modello a fare affidamento sulla propria elaborazione. I ricercatori volevano sapere se i modelli stessero realmente ragionando attraverso i passaggi o se si stessero solo aggrappando a parole specifiche, come date o nomi, che apparivano sia nella domanda che nella risposta.
Per scoprire la verità, il team ha progettato una serie di esperimenti astuti in cui ha alterato sistematicamente le informazioni fornite ai modelli. Hanno iniziato controllando se i modelli potessero risolvere i problemi quando venivano forniti i fatti e un esempio chiaro di come collegarli. Entrambi i modelli hanno performato bene in queste condizioni, ma i ricercatori sospettavano che questo potesse essere troppo facile. Hanno poi rimosso l'esempio di come collegare i fatti, lasciando che i modelli lo capissero da soli. I risultati sono stati rivelatori. Il modello Flan-T5, che era stato addestrato specificamente su compiti di ragionamento simili, ha continuato a performare molto bene anche senza l'esempio. Il modello LLaMA 2, tuttavia, ha incontrato grandi difficoltà senza quella guida, suggerendo che facesse affidamento pesantemente sul vedere il modello di ragionamento prima di poterlo seguire.
I ricercatori hanno poi adottato un approccio più drastico per vedere se i modelli comprendessero davvero il significato delle parole. Hanno rimescolato l'ordine delle parole all'interno dei fatti, trasformando frasi chiare in stringhe di testo disordinate e prive di senso. Se i modelli stessero realmente ragionando sul significato, questo caos avrebbe dovuto rendere le risposte impossibili da trovare. Sorprendentemente, le prestazioni dei modelli sono scese di pochissimo. Erano ancora in grado di scegliere la risposta corretta anche quando le frasi non avevano senso grammaticale. Ciò ha suggerito che i modelli non stessero leggendo le frasi come pensieri coerenti. Invece, stavano probabilmente scansionando il testo alla ricerca di parole chiave specifiche che corrispondessero alle opzioni di risposta. Quando i ricercatori hanno rimosso completamente quelle parole chiave corrispondenti, l'accuratezza dei modelli è crollata, confermando che spesso stavano solo associando parole piuttosto che dedurre la logica.
Per escludere la possibilità che i modelli stessero semplicemente memorizzando le risposte dai loro dati di addestramento, il team si è rivolto al dataset Bamboogle, che conteneva domande che i modelli non avevano mai visto prima. Qui, hanno introdotto un ultimo, rigoroso test. Hanno preso i nomi di persone, luoghi e date — le entità specifiche che spesso appaiono nelle risposte — e li hanno sostituiti con parole senza senso. Hanno anche rimescolato l'ordine delle parole nei fatti. Quando i modelli si sono trovati di fronte a queste versioni prive di senso, il modello LLaMA 2 è fallito quasi completamente. Non riusciva a trovare la risposta senza i nomi e le date familiari per guidarlo. Il modello Flan-T5, tuttavia, ha mostrato un tipo diverso di resilienza. Sebbene le sue prestazioni siano diminuite, è rimasto significativamente migliore dell'altro modello. Ciò suggerisce che, poiché Flan-T5 era stato esplicitamente addestrato su compiti di ragionamento, aveva sviluppato una capacità più robusta di seguire la catena logica, anche quando i riferimenti familiari venivano rimossi.
Lo studio conclude che, sebbene i grandi modelli linguistici possano apparire capaci di ragionare, il loro successo dipende spesso dal modo specifico in cui sono stati addestrati e dagli indizi presenti nel testo. Per i modelli che non sono stati sottoposti a un fine-tuning specifico su compiti di ragionamento, la capacità di rispondere a domande complesse sembra dipendere fortemente dal riconoscimento di parole e modelli familiari piuttosto che da una genuina deduzione logica. Anche quando sembrano pensare passo dopo passo, potrebbero semplicemente individuare le parole chiave corrette. Tuttavia, la ricerca suggerisce che quando un modello è addestrato con cura su dataset progettati per insegnargli come collegare i fatti, può sviluppare una capacità più genuina di ragionamento transitivo. Questa capacità permette di gestire domande anche quando le solite scorciatoie, come nomi o date riconoscibili, vengono rimosse. Le scoperte servono da promemoria: punteggi elevati nei test di ragionamento non provano sempre che una macchina comprenda la logica; a volte, è solo molto brava a trovare le parole giuste.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.