← Nieuwste papers
💬 NLP

On Defining Erasure Harms for NLP

Dit artikel adresseert het gebrek aan een samenhangende conceptuele basis voor het identificeren en meten van representationele schade in NLP door een gestructureerde definitie van "erasure" voor te stellen die de noodzakelijke componenten verheldert voor beoefenaars om het fenomeen expliciet te articuleren en te operationaliseren in diverse settings.

Oorspronkelijke auteurs: Yu Lu Liu, Arnav Goel, Jackie Chi Kit Cheung, Alexandra Olteanu, Ziang Xiao, Su Lin Blodgett

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yu Lu Liu, Arnav Goel, Jackie Chi Kit Cheung, Alexandra Olteanu, Ziang Xiao, Su Lin Blodgett

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een foto van een drukke straat kijkt. Als iemand een schaar pakt en de gezichten van een specifieke groep mensen uit die foto knipt, heb je "erasure" (uitwissing). Je ziet de straat, maar een hele groep mensen ontbreekt, of hun aanwezigheid is zo vaag dat je het nauwelijks opmerkt.

Dit artikel gaat over hoe wij, als bouwers en gebruikers van AI-taalsystemen (zoals chatbots of nieuws-samenvatters), moeten stoppen met simpelweg gissen wanneer dit "eruit snijden" gebeurt en moeten beginnen met het hebben van een duidelijke, gedeelde set regels.

Hier is de eenvoudige uitsplitsing van wat de auteurs zeggen:

Het Probleem: We Gebruiken Iedereen Verschillende Linialen

Op dit moment, wanneer onderzoekers over "erasure" in AI praten, gebruiken ze allemaal verschillende definities.

  • De "Te Brede" Liniaal: Sommigen zeggen: "Als een groep niet vaak genoeg wordt genoemd, is dat erasure." Dit is te vaag. Het is alsof je zegt "de kamer is rommelig" zonder te definiëren hoe "rommelig" er precies uitziet. Je kunt het niet meten.
  • De "Te Specifieke" Liniaal: Anderen zeggen: "Erasure is wanneer een AI afbeeldingen van inheemse mensen niet correct tagt." Dit is geweldig voor die specifieke taak, maar het helpt ons niet om erasure in een nieuws-samenvatting of een chatbot te begrijpen.

Omdat we geen standaarddefinitie hebben, is het moeilijk om tools te bouwerken die meten of een AI daadwerkelijk mensen schaadt door hen te "wissen".

De Oplossing: Een Recept met Zes Delen

De auteurs stellen een gestructureerd "recept" voor om erasure te definiëren. Ze zeggen dat voordat je kunt zeggen dat een AI iets heeft gewist, je expliciet zes specifieke gaten moet invullen. Denk aan het opzetten van een rechtszaak; je moet alle bewijsstukken op orde hebben voordat je een vonnis kunt vellen.

Dit zijn de zes ingrediënten die je nodig hebt om erasure te definiëren:

  1. Het Doelwit (Wie ontbreekt er?): Wie of wat zijn we bang te verliezen? Is het de identiteit van een specifiek persoon? Een hele cultuur? De geschiedenis van een specifieke gebeurtenis?
  2. Het Object (Waar kijken we naar?): Wat onderzoeken we? Is het de geschreven samenvatting van de AI? Een lijst met zoekresultaten? Een gegenereerd verhaal?
  3. De Achtergrondcondities (Waarom is het belangrijk?): Dit is het belangrijkste deel. Je moet de "onrechtvaardige patronen" identificeren die we willen vermijden.
    • Analogie: Stel je een nieuwsbericht voor dat zegt: "Er vond een schietpartij plaats," in plaats van "De politie schoot op een man." De "achtergrondconditie" is het historische patroon van media die de rol van de politie bij geweld verbergen. Als de AI dit patroon herhaalt, is het slecht. Als de AI alleen een willekeurig feit weglaat dat niet past bij een schadelijk patroon, is het misschien gewoon een fout, en geen erasure.
  4. De Basiskennis (Wat zou er moeten staan?): Welke informatie hoorde er in de output te zitten? Als je een AI vraagt een tekst samen te vatten, dan is de "basiskennis" de originele tekst. Als de AI iets weglaat dat niet in de originele tekst stond, is dat geen erasure; dat is gewoon een samenvatting.
  5. Het Alternatief (Hoe zou een "goede" versie eruitzien?): Je moet een betere versie van de output voorstellen. Als de AI een samenvatting schreef die de rol van de politie verborg, dan is het "alternatief" een samenvatting die duidelijk vermeldt dat de politie de schoten loste.
  6. De De-emphasis (Hoe werd het verborgen?): Hoe maakte de AI het doelwit minder zichtbaar vergeleken met de "goede" versie? Gebruikte de AI de lijdende vorm? Liet de AI een naam weg? Plaatte de AI de informatie helemaal onderaan een lijst?

Een Praktijkvoorbeeld uit het Papier

De auteurs gebruiken een nieuws-samenvatter om dit te laten zien.

  • De Situatie: Een artikel zegt: "Politieagenten schoten en doodden een man."
  • De AI Output: De AI vat het samen als: "Hij stierf bij een incident waarbij een wapen door een ambtenaar werd gebruikt."
  • Het Recept Toepassen:
    • Doelwit: De rol van de politie.
    • Achtergrondconditie: We weten dat media vaak proberen geweld door de politie te minimaliseren (een schadelijk patroon).
    • Basiskennis: Het originele artikel stelde duidelijk dat de politie de schoten loste.
    • Alternatief: Een samenvatting die zegt: "Politieagenten schoten en doodden hem."
    • De-emphasis: De AI gebruikte de lijdende vorm ("incident waarbij een wapen door een ambtenaar werd gebruikt") om te verhullen wie de trekker overhaalde.
    • Verdict: Dit is erasure. De AI nam een duidelijk feit en gebruikte taal om de rol van de politie minder zichtbaar te maken, waardoor een schadelijk historisch patroon werd gereproduceerd.

Waarom Dit Belangrijk Is

Het papier betoogt dat je niet simpelweg kunt zeggen "AI is bevooroordeeld" en daarna verder kunt gaan. Je moet specifiek zijn. Door deze zes gaten in te vullen, kunnen beoefenaren:

  1. Overeenstemming bereiken over wat er gebeurt: Stoppen met discussiëren over of iets wel of geen erasure is, en beginnen met meten hoeveel het gebeurt.
  2. Betere tools bouwen: Zodra je precies weet waar je naar zoekt (bijv. "lijdende vorm die de rol van de politie verbergt"), kun je specifieke tests bouwen om dit te vangen.
  3. Vals alarm vermijden: Je zult niet per ongeluk iets "erasure" noemen omdat er een feit ontbrak, als dat feit niet onderdeel was van een schadelijk patroon om te beginnen toe.

Wat het Papier NIET Zegt

  • Het beweert niet dat het oplossen van erasure makkelijk is.
  • Het zegt niet dat AI de enige oorzaak van deze problemen is (mensen schrijven het nieuws, mensen trainen de AI).
  • Het biedt geen magische oplossing of een specifieke softwaretool om dit vandaag op te lossen. Het biedt alleen een definitie en een raamwerk om mensen te helpen het probleem duidelijker te begrijpen.

Kortom, dit papier is een oproep om te stoppen met het woord "erasure" losjes te gebruiken. Het vraagt ons om onze detectivehoed op te zetten, de zes aanwijzingen te identificeren, en pas dan te verklaren dat een AI echt iemand of iets heeft gewist.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →