General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
Questo articolo introduce il General Phrase Debiaser, una pipeline multi-token automatica che mitiga i pregiudizi a livello di frase nei modelli di linguaggio con mascheramento generando frasi stereotipate da Wikipedia e utilizzandole per identificare e de-biasare i prompt che innescano tali pregiudizi, ottenendo riduzioni significative degli stereotipi di genere in vari domini e dimensioni dei modelli.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I computer che leggono e scrivono il linguaggio sono diventati straordinariamente abili, capaci di riassumere notizie, tradurre documenti e persino comporre poesie. Questi sistemi, noti come modelli linguistici, imparano studiando enormi quantità di testo provenienti da Internet, assorbendo i modelli, i fatti e le opinioni in essi contenuti. Tuttavia, poiché il linguaggio umano è pieno di pregiudizi storici e stereotipi culturali, questi modelli spesso imparano a ripeterli. Un computer potrebbe presumere che un infermiere sia sempre una donna o che un matematico sia sempre un uomo, semplicemente perché è ciò che ha visto più spesso nei suoi dati di addestramento. Questo è un problema significativo per chiunque cerchi di utilizzare questi strumenti in modo equo, poiché le macchine possono involontariamente rinforzare pregiudizi dannosi su genere, razza e professione. Sebbene i ricercatori abbiano da tempo cercato di risolvere questi problemi, la maggior parte dei tentativi precedenti si è concentrata sulla correzione di singole parole, trattando il pregiudizio come una semplice questione di sostituzione di alcuni termini problematici. Eppure, il pregiudizio nel mondo reale raramente vive in isolamento; si nasconde nel modo in cui le parole si combinano in frasi e proposizioni, dove il significato cambia in modi sottili e pericolosi.
Un team di ricercatori della Chinese Academy of Sciences, del Gruppo Alibaba e dell'Università di Bristol ha sviluppato un nuovo metodo per affrontare questo strato più profondo di pregiudizio. Chiamano il loro approccio General Phrase Debiaser, un sistema progettato per ripulire i modelli linguistici osservando gruppi di parole piuttosto che singole parole. I ricercatori hanno riconosciuto che, per risolvere davvero il problema, dovevano trovare le frasi specifiche in cui il pregiudizio del modello è più forte e poi insegnare al modello a ignorare tali associazioni. Il loro processo inizia con un modo intelligente per raccogliere le prove necessarie per la correzione. Invece di chiedere agli esseri umani di scrivere manualmente ogni possibile frase pregiudizievole, il che sarebbe lento e incompleto, il sistema scansiona le pagine di Wikipedia. Cerca collegamenti ipertestuali che connettono argomenti come carriere, matematica, arte e scienza, e li utilizza per identificare frasi stereotipate che il modello potrebbe aver appreso. Per esempio, potrebbe scoprire che il modello associa fortemente "uomo" con "teoria matematica" e "donna" con "arte della danza".
Una volta che il sistema ha identificato queste frasi pregiudiziali, passa alla seconda fase: trovare le domande esatte, o prompt, che scatenano il pregiudizio del modello. Immaginate di chiedere al computer di completare una frase come "Il [persona] è un esperto in [vuoto]". I ricercatori lasciano che il computer cerchi tra milioni di possibili frasi per trovare quelle in cui è più probabile che faccia una risposta pregiudizievole. Non cercano solo risposte di una singola parola; cercano risposte composte da più parole, come "teoria matematica" rispetto a "arte della danza", perché è lì che il vero pregiudismo spesso si nasconde. Misurando quanto diversamente il modello risponde a queste frasi quando il soggetto è un uomo rispetto a una donna, il sistema calcola un punteggio che rappresenta la forza del pregiudizio. I ricercatori utilizzano poi questo punteggio per guidare un processo di fine-tuning. Ri-alimentano il modello con queste specifiche frasi che scatenano il pregiudizio, ma questa volta regolano le impostazioni interne del modello per ridurre la differenza nelle sue risposte. L'obiettivo non è cancellare la conoscenza di matematica o arte del modello, ma garantire che non colleghi più tali campi a un genere specifico.
I risultati di questo lavoro dimostrano che mirare alle frasi è molto più efficace che mirare alle singole parole. I ricercatori hanno testato il loro metodo su tre modelli linguistici ben noti di diverse dimensioni e hanno scoperto che riduce significativamente il pregiudizio di genere sia nelle discipline professionali che in quelle accademiche. Nei test standard progettati per misurare il pregiudizio, i modelli sono migliorati drasticamente. Ad esempio, uno dei modelli, BERT, ha visto il suo punteggio di pregiudizio scendere da 0,35 a 0,12, mentre un altro, ALBERT, è sceso da 0,72 a 0,16. Questi numeri indicano che i modelli sono diventati molto meno propensi ad associare specifiche professioni o campi a un genere rispetto all'altro. Fondamentalmente, i ricercatori hanno anche controllato se questo processo di pulizia danneggiasse la capacità dei modelli di comprendere il linguaggio in generale. Hanno sottoposto i modelli de-biased a una serie di test linguistici standard che coprono grammatica, sentimento e logica, e hanno scoperto che i modelli mantenevano quasi tutte le loro abilità originali. La capacità di comprendere il linguaggio è rimasta intatta, dimostrando che è possibile rimuovere gli stereotipi dannosi senza rompere l'intelligenza della macchina.
Questo approccio segna un cambiamento nel modo in cui i ricercatori pensano di correggere l'intelligenza artificiale. I metodi precedenti spesso si affidavano a elenchi esterni di parole scritti dagli esseri umani o cercavano di correggere l'intero vocabolario del modello in una volta sola, il che poteva essere inefficiente o mancare la sfumatura di come il pregiudizio funzioni realmente. Il General Phrase Debiaser, al contrario, automatizza la scoperta di frasi pregiudiziali e mira alle specifiche combinazioni di parole dove esiste il problema. I ricercatori sostengono che questa correzione a livello di multi-token è essenziale perché il pregiudizio umano raramente è una singola parola; è un modello di associazione che si estende attraverso le frasi. Sebbene lo studio si sia concentrato sui modelli "encoder-only", che sono un tipo specifico di modello linguistico, i principi scoperti potrebbero potenzialmente applicarsi anche ad altri tipi di sistemi. Il lavoro dimostra che guardando più da vicino la struttura del linguaggio, possiamo costruire strumenti che siano non solo più intelligenti, ma anche più equi, assicurando che i computer del futuro riflettano la diversità del mondo che servono piuttosto che i limiti dei loro dati di addestramento.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.