General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
Dit artikel introduceert de General Phrase Debiaser, een automatische multi-token pijplijn die woordniveau-biases in gemaskeerde taalmodellen mitigeert door stereotiepe frases uit Wikipedia te genereren en deze te gebruiken om bias-veroorzakende prompts te identificeren en te debiasen, waarbij significante reducties van genderstereotypen worden bereikt over diverse domeinen en modelgroottes.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Computers die taal kunnen lezen en schrijven zijn opmerkelijk bekwaam geworden, in staat om nieuws samen te vatten, documenten te vertalen en zelfs poëzie te componeren. Deze systemen, bekend als taalmodellen, leren door enorme hoeveelheden tekst van het internet te bestuderen, waarbij ze de patronen, feiten en meningen die erin zijn opgenomen, absorberen. Omdat menselijke taal echter vol zit met historische vooroordelen en culturele stereotypen, leren deze modellen ze vaak te herhalen. Een computer kan ervan uitgaan dat een verpleegster altijd een vrouw is of dat een wiskundige altijd een man is, simpelweg omdat dat is wat het het vaakst heeft gezien in de trainingsdata. Dit is een aanzienlijk probleem voor iedereen die deze hulpmiddelen eerlijk wil gebruiken, aangezien de machines onbedoeld schadelijke vooroordelen over gender, ras en beroep kunnen versterken. Hoewel onderzoekers al lang proberen deze problemen op te lossen, richtten de meeste eerdere pogingen zich op het corrigeren van individuele woorden, waarbij vooroordelen werden behandeld als een eenvoudige kwestie van het vervangen van een paar problematische termen. Toch leeft echte bias zelden geïsoleerd; het verbergt zich in de manier waarop woorden zich combineren tot zinnen en frasen, waar de betekenis op subtiele, gevaarlijke wijzen verschuift.
Een team van onderzoekers van de Chinese Academy of Sciences, Alibaba Group en de University of Bristol heeft een nieuwe methode ontwikkeld om dit diepere laag van vooroordelen aan te pakken. Ze noemen hun aanpak de General Phrase Debiaser, een systeem dat ontworpen is om taalmodellen op te schonen door naar groepen woorden te kijken in plaats van alleen naar individuele woorden. De onderzoekers beseften dat om het probleem echt op te lossen, ze de specifieke zinsneden moesten vinden waar het vooroordeel van het model het sterkst is, en het model vervolgens moeten leren die associaties te negeren. Hun proces begint met een slimme manier om het bewijs te verzamelen dat nodig is voor correctie. In plaats van mensen handmatig elke mogelijke bevooroordeelde frase te laten opschrijven, wat traag en incompleet zou zijn, scant het systeem Wikipedia-pagina's. Het zoekt naar hyperlinks die verbinding maken met onderwerpen zoals carrières, wiskunde, kunst en wetenschap, en gebruikt deze om stereotype zinsneden te identificeren die het model mogelijk heeft geleerd. Het kan bijvoorbeeld vinden dat het model "man" sterk associeert met "wiskundige theorie" en "vrouw" met "danskunst".
Zodra het systeem deze bevooroordeelde zinsneden heeft geïdentificeerd, gaat het naar de tweede fase: het vinden van de exacte vragen, of prompts, die het vooroordeel van het model triggeren. Stel je voor dat je de computer vraagt om een zin aan te vullen zoals: "De [persoon] is een expert in [blank]." De onderzoekers lieten de computer door miljoenen mogelijke zinnen zoeken om de zinnen te vinden waarbij de computer het meest waarschijnlijk een bevooroordeelde gok zal doen. Ze kijken niet alleen naar antwoorden van één woord; ze kijken naar antwoorden van meerdere woorden, zoals "wiskundige theorie" versus "danskunst", omdat dat is waar de echte bias vaak verborgen zit. Door te meten hoe verschillend het model reageert op deze zinsneden wanneer het onderwerp een man versus een vrouw is, berekent het systeem een score die de sterkte van het vooroordeel vertegenwoordigt. De onderzoekers gebruiken deze score vervolgens om een fine-tuning proces te sturen. Ze voeren deze specifieke, vooroordelen-triggerende zinnen terug in het model, maar passen dit keer de interne instellingen van het model aan om het verschil in de reacties te verminderen. Het doel is niet om de kennis van het model over wiskunde of kunst uit te wissen, maar om ervoor te zorgen dat het die velden niet langer aan een specifiek gender koppelt.
De resultaten van dit werk laten zien dat het richten op zinsneden veel effectiever is dan het richten op individuele woorden. De onderzoekers testten hun methode op drie bekende taalmodellen van verschillende groottes en ontdekten dat het de genderbias aanzienlijk verminderde in zowel carrière- als academische disciplines. In standaardtests die bedoeld zijn om bias te meten, verbeterden de modellen spectaculair. Bijvoorbeeld, een van de modellen, BERT, zag zijn bias-score dalen van 0,35 naar 0,12, terwijl een ander, ALBERT, daalde van 0,72 naar 0,16. Deze cijfers geven aan dat de modellen veel minder geneigd zijn om specifieke beroepen of velden aan één gender boven het andere te koppelen. Cruciaal is dat de onderzoekers ook controleerden of dit schoonmaakproces de algemene taalvaardigheid van de modellen beschadigde. Ze lieten de gedebiaanseerde modellen een batterij van standaard taaltests doorlopen die grammatica, sentiment en logica beslaan, en vonden dat de modellen bijna al hun oorspronkelijke vaardigheden behielden. Het vermogen om taal te begrijpen bleef intact, wat bewijst dat het mogelijk is om schadelijke stereotypen te verwijderen zonder de intelligentie van de machine te breken.
Deze aanpak markeert een verschuiving in hoe onderzoekers nadenken over het repareren van kunstmatige intelligentie. Eerdere methoden vertrouwden vaak op externe lijsten met woorden geschreven door mensen of probeerden de gehele vocabulaire van het model tegelijkertijd te corrigeren, wat inefficiënt kon zijn of de nuance van hoe bias werkelijk werkt, kon missen. De General Phrase Debiaser automatiseert daarentegen de ontdekking van bevooroordeelde zinsneden en richt zich op de specifieke combinaties van woorden waar het probleem bestaat. De onderzoekers stellen dat deze correctie op multi-token niveau essentieel is omdat menselijke bias zelden een enkel woord is; het is een patroon van associatie dat zich uitstrekt over zinsneden. Hoewel de studie zich richtte op encoder-only modellen, een specifiek type taalmodel, zouden de principes die zij ontdekten potentieel toepasbaar zijn op andere soorten systemen. Het werk laat zien dat we, door nauwer naar de structuur van taal te kijken, tools kunnen bouwen die niet alleen slimmer zijn, maar ook eerlijker, waardoor we ervoor zorgen dat de computers van de toekomst de diversiteit van de wereld die ze dienen weerspiegelen in plaats van de beperkingen van hun trainingsdata.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.