← Nieuwste papers
💬 NLP

Do Large Language Models Reflect Demographic Pluralism in Safety?

Dit paper introduceert Demo-SafetyBench, een methode om de demografische diversiteit in de veiligheidsnormen van grote taalmodellen te evalueren door veiligheidsprompts te categoriseren en de variatie in perceptie tussen verschillende bevolkingsgroepen te meten.

Oorspronkelijke auteurs: Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

Gepubliceerd 2026-02-10
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een wereldwijde jury bent die moet beslissen wat "gevaarlijk" of "ongepast" is. Als die jury alleen maar bestaat uit mensen uit één specifieke stad, met één specifieke achtergrond, dan zullen hun regels heel erg gaan lijken op de lokale gewoontes van die stad. Wat in die stad heel normaal is, wordt door de jury misschien als "fout" gezien, terwijl iets wat elders heel erg beledigend is, door de jury misschien wordt genegeerd.

Dit onderzoek, genaamd Demo-SafetyBench, gaat precies over dit probleem bij AI (zoals ChatGPT).

Het probleem: De "Morele Gemiddelde" Valstrik

Op dit moment worden AI-modellen getraind om "veilig" te zijn. Maar "veiligheid" is geen vaste wet zoals de zwaartekracht; het is een sociale afspraak. Wat een tiener in een grote stad ongevaarlijk vindt, kan voor een grootouder op het platteland heel schokkend zijn.

De onderzoekers ontdekten dat de huidige tests voor AI vaak een soort "moreel gemiddelde" gebruiken. Ze kijken naar wat de meeste mensen (vaak uit het Westen) veilig vinden en dwingen de AI om dat te volgen. Hierdoor worden de nuances van verschillende culturen, leeftijden en achtergronden weggepoetst. De AI wordt een soort "saaie eenheidsworst" die de stemmen van minderheden niet echt begrijpt.

De oplossing: Een "Culturele Spiegel" (Demo-SafetyBench)

De onderzoekers hebben een nieuwe manier bedacht om AI te testen. In plaats van alleen te vragen: "Is dit zinnetje gevaarlijk?", voegen ze een extra laag toe: "Is dit zinnetje gevaarlijk voor een student in een drukke stad, of voor een gepensioneerde in een rustig dorp?"

Ze hebben een systeem gebouwd dat werkt in twee stappen:

  1. De Diversiteits-Fabriek: Ze hebben een enorme database gemaakt van 43.000 vragen. Ze hebben deze vragen niet alleen ingedeeld in categorieën (zoals 'haatzaaien' of 'drugs'), maar ze hebben er ook een "demografisch label" aan geplakt. Het is alsof je een bibliotheek maakt waar elk boek niet alleen op onderwerp is gesorteerd, maar ook op de achtergrond van de schrijver.
  2. De AI-Rechters: Vervolgens lieten ze verschillende AI-modellen (zoals GPT-4o) optreden als rechters. Ze lieten de AI-rechters de vragen beoordelen terwijl ze de "bril" van verschillende groepen opzetten.

Wat hebben ze ontdekt? (De conclusie)

De resultaten waren heel interessant:

  • AI heeft een "vooroordeel-bril" op: Zelfs de slimste AI (zoals GPT-4o) reageert anders afhankelijk van de demografische context. De AI is niet neutraal; hij heeft nog steeds een verborgen moreel kompas dat beïnvloed wordt door wie hij is en hoe hij getraind is.
  • Grootte maakt een verschil: De hele grote, dure AI-modellen zijn een stuk stabieler en eerlijker in hun oordeel. De kleinere, goedkopere AI-modellen zijn veel grilliger; zij schieten sneller door in vooroordelen of extreme reacties.
  • Efficiëntie: Het goede nieuws is dat je niet altijd de allerduurste, meest energieverslindende AI nodig hebt om veiligheid te testen. Kleinere modellen kunnen ook heel goed worden gebruikt als "controleur", zolang je weet waar hun zwakke plekken liggen.

Samenvattend in één metafoor

Denk aan AI als een nieuwe wereldreiziger. Tot nu toe hebben we die reiziger alleen geleerd wat de regels zijn in zijn eigen geboorteland. Dit onderzoek bouwt een wereldwijde etiquette-gids. Het helpt ons te begrijpen dat een AI pas echt "veilig" is als hij niet alleen de regels van de meerderheid kent, maar ook begrijpt dat de wereld bestaat uit miljarden verschillende manieren om naar goed en kwaad te kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →