Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled
Questo studio dimostra che, controllando l'espansione della dimensionalità mediante l'uso di grandi modelli linguistici non addestrati, il potere predittivo dei vettori di LLM addestrati per i tempi di lettura umana e i dati fMRI esibisce uno scaling inverso, con il valore aggiunto dell'addestramento che diminuisce fino a zero con soli pochi miliardi di parametri.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Per decenni, gli scienziati hanno osservato i computer imparare a leggere e scrivere con una velocità che sembra quasi biologica. Queste macchine, note come modelli linguistici di grandi dimensioni, vengono addestrate su vaste biblioteche di testi umani finché non riescono a prevedere la parola successiva in una frase con una precisione sorprendente. Poiché gestiscono il linguaggio così bene, i ricercatori hanno iniziato a chiedersi se queste macchine non stessero solo imitando noi, ma stessero effettivamente rispecchiando il modo in cui i nostri stessi cervelli elaborano il linguaggio. La speranza prevalente era che, man mano che questi modelli diventavano più grandi e complessi, sarebbero diventati sempre più bravi a prevedere quanto tempo impiega un essere umano a leggere una parola, o come i nostri cervelli si illuminano quando ascoltiamo una storia. Questa idea suggeriva che l'architettura di queste menti digitali potesse essere una mappa dell'architettura del pensiero umano, implicando che qualsiasi fallimento nel corrispondere ai dati umani fosse semplicemente una questione di necessità di maggiore potenza di calcolo.
Tuttavia, un nuovo studio condotto da ricercatori dell'Ohio State University e della University of California, San Diego, mette in discussione questa visione ottimistica. Hanno scoperto che, quando controllavano attentamente la pura dimensione dei dati prodotti da questi modelli, la relazione tra la dimensione del modello e le prestazioni simili a quelle umane cambiava in un modo specifico: il beneficio aggiuntivo dell'addestramento scompariva. Invece di rendere i modelli più grandi significativamente migliori rispetto alle loro controparti non addestrate, il processo di addestramento non rendeva i modelli più grandi migliori delle versioni non addestrate della stessa dimensione. Lo studio suggerisce che il successo apparente di questi massicci sistemi fosse in gran parte un'illusione creata dal puro volume di informazioni a cui potevano accedere, piuttosto che da una genuina comprensione del linguaggio. Quando i ricercatori hanno rimosso questo vantaggio, l'addestramento che rendeva questi modelli così potenti sembrava non offrire alcun beneficio extra rispetto a una versione completamente non addestrata della stessa macchina.
Per capire come siano arrivati a questa conclusione, bisogna prima guardare a come questi modelli vengono tipicamente testati. I ricercatori spesso alimentano un modello linguistico con una storia e confrontano lo stato interno del modello con i dati umani, come il tempo di pausa di una persona su una specifica parola o come il cervello risponde a una frase. In studi precedenti, sembrava che i modelli più grandi, che hanno più variabili interne a disposizione, prevedessero costantemente meglio il comportamento umano. Ciò ha portato a una teoria chiamata "ipotesi qualità-potenza": più grande è il modello, più esso somiglia alla mente umana. Ma i ricercatori sospettavano un difetto nascosto in questa logica. Quando un modello diventa più grande, non diventa solo più intelligente; produce anche un numero molto più elevato di segnali interni, o vettori, da analizzare. È come dare a uno studente un test con il doppio delle domande; anche se lo studente non sa nulla, avere più domande gli dà più possibilità di indovinare la risposta giusta per fortuna. I ricercatori si resero conto che gli studi precedenti potrebbero aver misurato il beneficio di avere più domande, piuttosto che il beneficio di avere un cervello migliore.
Per risolvere questo enigma, il team ha progettato una serie di esperimenti che separassero l'effetto della dimensione dall'effetto dell'intelligenza. Hanno raccolto dati da cinque diverse famiglie di modelli linguistici, che vanno da modelli piccoli con qualche centinaio di milioni di parametri a modelli massicci con 66 miliardi di parametri. Hanno testato questi modelli contro dati umani reali, inclusi i tempi di lettura di persone che leggevano storie naturali e scansioni cerebrali di persone che ascoltavano quelle stesse storie. Nel loro primo esperimento, hanno replicato i risultati precedenti: man mano che i modelli diventavano più grandi, le loro previsioni del comportamento umano sembravano effettivamente migliorare. Ciò ha confermato che l'effetto "qualità-potenza" era visibile in superficie.
Ma poi, hanno introdotto un controllo cruciale. Hanno preso gli stessi modelli e li hanno osservati prima che fossero addestrati su qualsiasi testo. Questi modelli non addestrati hanno la stessa dimensione e struttura dei modelli addestrati, ma sono essenzialmente rumore casuale, privi di conoscenza del linguaggio. Confrontando i modelli addestrati con i loro gemelli non addestrati, i ricercatori potevano vedere quanto dell'هmiglioramento derivasse dall'effettivo apprendimento e quanto derivasse semplicemente dal fatto di avere un numero maggiore di segnali interni con cui lavorare. Hanno utilizzato un metodo simile a un serbatoio, dove una rete non addestrata di grandi dimensioni agisce come fonte di materia prima che può essere plasmata da un semplice classificatore. Se l'addestramento stesse rendendo il modello veramente più simile all'uomo, la versione addestrata avrebbe dovuto superare significativamente la versione non addestrata, specialmente man mano che i modelli crescevano.
I risultati sono stati sorprendenti. Quando i ricercatori hanno controllato la dimensione dei segnali interni, il vantaggio extra dell'addestramento è scomparso. Infatti, per i modelli superiori a pochi miliardi di parametri, le versioni addestrate non performavano meglio di quelle non addestrate. Su diversi dataset, il beneficio extra dell'addestramento è sceso a zero. Ciò significa che i massicci miglioramenti osservati negli studi precedenti non erano dovuti al fatto che i modelli più grandi avessero appreso una comprensione più profonda del linguaggio, ma semplicemente perché avevano più dimensioni interne per adattarsi ai dati. I ricercatori hanno scoperto che, man mano che i modelli crescevano oltre un certo punto, il contributo dell'addestramento alla capacità di adattamento del modello rispetto a una base non addestrata scendeva a zero, invece di aumentare. Più grande diventava il modello, meno il processo di addestramento aggiungeva alla potenza predittiva fornita dalla dimensione del modello stesso.
Lo studio ha anche esaminato i diversi strati all'interno dei modelli, controllando se le sezioni centrali della rete, che alcuni lavori precedenti suggerivano fossero più importanti, si comportassero diversamente. Hanno trovato lo stesso schema: il contributo dell'addestramento è sceso a zero in tutti gli strati con la crescita dei modelli. Anche quando hanno regolato i loro metodi statistici per tenere conto della possibilità che i modelli stessero semplicemente raggiungendo un limite nella capacità di prevedere i dati umani, la tendenza rimaneva la stessa. I ricercatori hanno concluso che il successo di questi grandi modelli nel prevedere il comportamento umano è in gran parte dovuto a un effetto statistico in cui avere più variabili permette un migliore adattamento, piuttosto che a una genuina riflessione della cognizione umana.
Questa scoperta suggerisce un significativo disallineamento tra il modo in cui questi sistemi artificiali sono costruiti e il modo in cui funzionano i cervelli umani. Il processo di addestramento che rende questi modelli così bravi a generare testo non li rende necessariamente migliori modelli della lettura o dell'attività cerebrale umana. In effetti, lo studio sostiene che le versioni non addestrate di queste reti massicce, che agiscono come complessi serbatoi di connessioni casuali, potrebbero essere altrettanto efficaci nel prevedere i dati umani quanto le versioni costose e completamente addestrate. I ricercatori propongono che gli studi futuri dovrebbero utilizzare questi modelli non addestrati come standard di riferimento per garantire che qualsiasi miglioramento attribuito all'addestramento sia reale e non solo un sottoprodotto della dimensione del modello. Sebbene l'idea che "più grande è meglio" abbia guidato il campo per anni, questo lavoro suggerisce che, nel regno dell'elaborazione del linguaggio umano, esiste un punto in cui aggiungere più dimensione e addestramento non ci avvicina alla comprensione della mente umana, ma ci porta invece più lontano.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.