← Nieuwste papers
💬 NLP

Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection

Het Lingo_Research_Group-paper presenteert een systematische evaluatie van twaalf prompt-varianten met behulp van het Gemma3-27B-model voor SemEval-2026 Taak 9, waarmee wordt aangetoond dat hoewel prompt-gebaseerde benaderingen effectief grove polarisatie detecteren over 22 talen, zij te maken krijgen met toenemende uitdagingen bij fijnmazige en multi-label sociolinguïstische classificatie.

Oorspronkelijke auteurs: Pritam Kadasi, Anuj Tiwari, Mayank Singh

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pritam Kadasi, Anuj Tiwari, Mayank Singh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen dat zich in 22 verschillende talen over de hele wereld afspeelt. Het mysterie gaat niet over een gestolen juweel, maar over iets dat "polarisatie" wordt genoemd. In eenvoudige termen is polarisatie wanneer mensen op sociale media tegen elkaar beginnen te schreeuwen, harde lijnen trekken tussen "ons" en "hen", en weigeren naar de andere kant te luisteren.

Het team achter dit onderzoek, de Lingo Research Group, deed mee aan een wereldwijde wedstrijd (SemEval-2026) om te zien of ze een superintelligente computer (AI) konden leren om dit gekibbel te herkennen, uit te zoeken waarover ze ruziën, en hoe ze ruziën.

Hier is hoe ze het deden, uitgelegd met enkele alledaagse analogieën:

De Drie Niveaus van het Mysterie

De wedstrijd had drie moeilijkheidsgraden, zoals in een videogame:

  1. Niveau 1 (De "Gebeurt het wel?" Check): De AI hoeft alleen maar "Ja" of "Nee" te antwoorden. Is deze post boos en verdeeldheid zaaiend, of is het gewoon een normale post?
    • Analogie: Zoals een rookmelder. Het hoeft alleen maar te zeggen: "Is er rook?"
  2. Niveau 2 (De "Waar gaat het over?" Check): Als een post gepolariseerd is, waar vechten ze dan over? Zijn het politici? Een specifieke groep mensen? Een religie? Geslacht?
    • Analogie: Zoals een detective die vraagt: "Wie is de verdachte?" De AI moet één of meer verdachten uit een opstelling kiezen.
  3. Niveau 3 (De "Hoe vechten ze?" Check): Dit is het moeilijkste niveau. Hoe wordt de haat geuit? Worden er stereotypen gebruikt? Worden mensen uitgescholden? Gedraagt men zich alsof men niet om de gevoelens van anderen geeft?
    • Analogie: Zoals het analyseren van de stijl van het gevecht. Gebruiken ze een mes, een stomp voorwerp, of schreeuwen ze alleen maar? Dit vereist het herkennen van subtiel, lastig gedrag.

Het Gereedschap: De "Prompt" als Recept

In plaats van de computer te onderwijzen door het duizenden voorbeelden te laten zien (wat is alsof je een student dwingt om een tekstboek uit het hoofd te leren), gebruikte het team prompts. Zie een prompt als een recept of een set instructies die aan een zeer getalenteerde maar letterlijke chef (de AI) wordt gegeven.

Het team probeerde 12 verschillende recepten.

  • Sommige recepten waren heel kort: "Is dit boos?"
  • Sommige waren gedetailleerd: "Zoek naar woorden die mensen in groepen verdelen. Als je sarcasme ziet, controleer dan of het gemeen is. Hier zijn drie voorbeelden van hoe dat eruitziet..."

Ze testten deze recepten op twee verschillende "chefs" (AI-modellen): aya-101 en Gemma3-27B. Ze ontdekten dat Gemma3-27B de betere chef was, dus gebruikten ze deze voor de uiteindelijke wedstrijd.

De Resultaten: Goed in de Basis, Worstelend met Nuance

De resultaten van het team waren een mix van succes en strijd, wat een interessant verhaal vertelt:

  • Niveau 1 (Rookmelder): De AI was zeer goed in dit. Het identificeerde gepolariseerde posts gemiddeld 76% van de tijd correct. Het is als een rookmelder die zelden een brand mist.
  • Niveau 2 (De Verdachten): De score daalde naar ongeveer 59%. Het was moeilijker om precies aan te wijzen wie er werd aangevallen.
  • Niveau 3 (De Vechtstijl): De score daalde nog verder naar ongeveer 44%. Dit was het moeilijkste deel.

Waarom werd het moeilijker?
De auteurs leggen uit dat naarmate de taak specifieker wordt, de AI in de war raakt.

  • Het "Conservatieve Chef"-probleem: De AI was getraind om heel voorzichtig te zijn. De AI zei alleen "Ja, dit is gepolariseerd" als het bewijs superduidelijk was (zoals iemand die een scheldwoord schreeuwt).
  • De "Sarcasme-val": In het Engels vechten mensen vaak met behulp van sarcasme, ironie of slimme woordspelingen (bijv. "Oh geweldig, weer een socialist in de naam van Jezus"). De AI, die te letterlijk is, miste deze omdat er geen overduidelijke "vechtwoorden" waren. De AI dacht: "Geen directe beledigingen? Dan zal het wel veilig zijn."
  • De "Direct vs. Indirect" Kloof: In veel andere talen (zoals Hindi of Chinees) zijn mensen vaak directer in hun argumenten. De AI was goed in het opsporen van die directe klappen, maar worstelde met de subtiele, indirecte Engelse argumenten.

De Taalpuzzel

De AI presteerde niet hetzelfde in elke taal.

  • Nepalees en Chinees waren makkelijk voor de AI omdat de polarisatie vaak heel duidelijk en direct was (zoals "Groep A vs. Groep B").
  • Engels was verrassend moeilijk. Omdat Engelse sprekers veel sarcasme en culturele afkortingen gebruiken, miste de AI de gevechten steeds weer. Het is alsof je een grap probeert te begrijpen in een taal die je niet volledig beheerst; je hoort de woorden, maar je mist de clou.

De Belangrijkste Conclusie

Het paper concludeert dat AI goed is in het opsporen van de "luide" gevechten (Niveau 1), maar worstelt met de "stille" of "slimme" gevechten (Niveau 2 en 3).

Het team leerde dat je niet alleen een simpele instructie aan een AI kunt geven en verwachten dat het complexe menselijke emoties over 22 verschillende culturen heen begrijpt. Hoe meer je de AI vraagt om de nuance (het "hoe" en "wie") te analyseren, hoe meer de kans groot is dat het de subtiele signalen mist, vooral wanneer mensen sarcastisch of indirect zijn.

Kortom: De AI is een goede detective voor overduidelijke misdaden, maar heeft meer training nodig om de subtiele, slimme en sarcastische manieren te begrijpen waarop mensen online ruzie maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →