Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review
Questa recensione sintetizza le prove provenienti dalle prospettive rappresentazionale, comportamentale e meccanicistica sull'accordo soggetto-verbo, la negazione e la generalizzazione composizionale nei Transformer preaddestrati per rivelare distinti modelli di convergenza e frammentazione, proponendo infine una diagnostica di accessibilità e d'uso per chiarire gli attuali limiti e guidare la futura ricerca trasversale tra i diversi livelli.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il linguaggio è un sistema di regole che ci permette di prendere idee semplici e combinarle in infiniti nuovi pensieri. Per decenni, gli scienziati si sono chiesti se i massicci programmi informatici che ora scrivono testi fluidi e rispondono a domande complesse abbiano veramente imparato queste regole, o se stiano semplicemente imitando schemi già visti in precedenza. Questi programmi, noti come modelli linguistici pre-addestrati, sono addestrati su enormi quantità di scrittura umana. Possono produrre frasi che suonano perfettamente naturali, portando molti a presumere che comprendano la grammatica e il significato nello stesso modo in cui lo fanno gli esseri umani. Tuttavia, produrre le parole giuste non è la stessa cosa che sapere perché quelle parole vadano insieme. Un programma potrebbe indovinare una frase per caso, o facendo affidamento su una scorciatoia, senza comprendere realmente la logica sottostante. Per risolvere questo mistero, i ricercatori hanno sviluppato tre modi diversi per guardare dentro questi modelli: controllare quali informazioni sono memorizzate nella loro memoria interna, testare ciò che effettivamente producono nel loro output e tracciare i percorsi specifici che li portano a prendere una decisione.
Una nuova revisione condotta dai ricercatori Yizhe Wang e Zhenhua Ling unisce questi tre modi di guardare per vedere se raccontano la stessa storia. Gli autori si sono concentrati su tre aree specifiche del linguaggio che sono essenziali per comprendere come funzionano questi modelli: come i verbi concordano con i loro soggetti, come la parola "non" cambia il significato di una frase e come i modelli combinano parti familiari per creare nuove idee complesse. Riunendo e confrontando centinaia di studi che utilizzavano questi tre metodi, i ricercatori hanno scoperto che la risposta dipende interamente da quale parte del linguaggio si sta interrogando. A volte l'evidenza proveniente dai tre metodi coincide perfettamente; altre volte, i metodi raccontano storie contrastanti, rivelando lacune in ciò che i modelli sanno realmente.
La storia di successo più chiara che i ricercatori hanno trovato riguarda la concordanza soggetto-verbo, ovvero la regola secondo la quale un soggetto singolare richiede un verbo singolare, come "il gatto corre", mentre un soggetto plurale richiede un verbo plurale, come "i gatti corrono". In quest'area, i tre diversi modi di guardare i modelli concordano. Quando i ricercatori hanno guardato dentro gli stati interni del modello, potevano trovare un segnale chiaro se un sostantivo fosse singolare o plurale. Quando hanno testato l'output del modello, esso sceglieva quasi sempre la forma verbale corretta. Cosa più importante, quando i ricercatori sono intervenuti per cambiare quel segnale interno, il comportamento del modello è cambiato in modo prevedibile, costringendolo a scegliere il verbo errato. Questa convergenza suggerisce che, per le regole grammaticali semplici, questi modelli hanno realmente appreso la relazione e la utilizzano per prendere decisioni.
Il quadro diventa molto più complicato quando si osserva la negazione, ovvero come i modelli gestiscono la parola "non". Qui, le tre lenti non concordano. I controlli interni mostrano che i modelli possono rilevare la presenza della parola "non" e capire approssimativamente a cosa si applichi in una frase. Tuttavia, quando ai modelli viene chiesto di produrre testo o rispondere a domande basate su una frase negata, spesso falliscono nell'applicare il corretto significato. Potrebbero vedere la parola "non" ma agire comunque come se la frase fosse positiva. I ricercatori hanno scoperto che, sebbene i modelli possano individuare il marcatore, non lo utilizzano in modo affidabile per invertire la verità dell'affermazione. È come se il modello vedesse il segnale ma non seguisse l'istruzione che esso fornisce. Questa discrepanza significa che, sebbene i modelli possiedano i pezzi dell'informazione, non li utilizzano costantemente per comprendere il significato completo.
La terza area, che riguarda la combinazione di diverse parti del linguaggio per creare nuovi significati, mostra la maggiore confusione. Questa è la capacità di prendere parole e regole note e applicarle a situazioni che il modello non ha mai visto prima. L'evidenza qui è frammentata. Alcuni studi mostrano che i modelli possono gestire combinazioni semplici, specialmente quando i ricercatori forniscono suggerimenti o suddividono il compito in passaggi più piccoli. Altri studi mostrano che, quando i modelli vengono lasciati a risolvere catene di ragionamento complesse autonomamente, spesso falliscono. Il problema è che i diversi studi non stanno guardando la stessa cosa. Alcuni testano se il modello può riconoscere uno schema, mentre altri testano se sia in grado di costruire una nuova idea da zero. Poiché i ricercatori non sono riusciti a trovare un modo unico e coerente per misurare questa capacità attraverso tutti gli studi, non hanno potuto concludere se i modelli possiedano davvero una capacità generale di combinare le idee o se siano solo bravi in trucchi specifici e ristretti.
Gli autori della revisione suggeriscono che questi diversi risultati accadano perché alcune caratteristiche linguistiche sono più facili da isolare e utilizzare rispetto ad altre. Per la concordanza soggetto-verbo, la caratteristica è semplice e isolata, quindi il modello può trovarla e usarla. Per la negazione, il modello può trovare il marcatore ma fatica a usarlo per cambiare l'intero significato. Per le combinazioni complesse, la caratteristica è così diffusa e difficile da definire che il modello non riesce nemmeno a isolarla chiaramente. I ricercatori concludono che non possiamo assumere che questi modelli conoscano il linguaggio in senso generale. Inveve, la loro conoscenza è specifica per il compito. Sono eccellenti in alcune cose, come far concordare i verbi, sono inconsistenti in altre, come la comprensione della negazione, e sono ancora non provati nella sfida più complessa di creare nuove idee partendo da parti preesistenti. Questa scoperta cambia il modo in cui dovremmo valutare questi sistemi: non possiamo limitarci a guardare se ottengono la risposta corretta, ma dobbiamo anche verificare se stiano utilizzando la logica corretta per arrivarci.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.