← Nieuwste papers
💬 NLP

YEZE at SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization via Heterogeneous Ensembling

Het artikel presenteert YEZE, een systeem voor SemEval-2026 Taak 9 dat online polarisatie in 22 talen detecteert door gebruik te maken van een heterogeen ensemble van XLM-RoBERTa-large- en mDeBERTa-v3-base-modellen, waarbij onafhankelijke taakmodellering gecombineerd met klassenweging het meest effectief bleek voor het hanteren van ernstige labelonevenwichtigheid.

Oorspronkelijke auteurs: Fengze Guo (University of Tübingen), Yue Chang (University of Tübingen)

Gepubliceerd 2026-05-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fengze Guo (University of Tübingen), Yue Chang (University of Tübingen)

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorm, wereldwijd stadsplein waar mensen uit 22 verschillende landen tegelijkertijd schreeuwen, fluisteren en ruziën. Soms lopen deze discussies uit de hand en veranderen ze in "polarisatie" – waarbij mensen stoppen met naar elkaar te luisteren en alleen nog maar naar hun eigen kant luisteren.

Het artikel dat je deelde beschrijft een team van onderzoekers (YEZE) dat een speciale set "digitale oren" heeft gebouwd om naar dit stadsplein te luisteren en drie dingen te achterhalen:

  1. Is deze discussie verhit? (Binaire detectie)
  2. Waarover of over wie ruziën ze? (Doelclassificatie: politiek, ras, religie, enz.)
  3. Hoe ruziën ze? (Manifestatie: gebruiken ze beledigingen, stereotypen of taal die mensen ontmenselijkt?)

Hier is hoe ze dit deden, eenvoudig uitgelegd:

1. Het Probleem: Een Lawaaierige, Ongelijke Menigte

De onderzoekers stonden voor twee grote hindernissen:

  • De Taalbarrière: Ze moesten 22 verschillende talen begrijpen, van Engels en Spaans tot Amhaars en Birmees. Het is alsof je probeert een gesprek te begrijpen waarbij iedereen een andere dialect spreekt.
  • Het "Zeldzame Gebeurtenis"-Probleem: In de data waren de meeste berichten kalm. Slechts een paar waren echt gepolariseerd. Het is alsof je probeert een enkele rode knikker te vinden in een emmer vol witte knikkers. Als je elke keer "wit" zou raden, zou je het vaak goed hebben, maar dan mis je de rode knikkers. Dit heet "label-ongelijkheid".

2. De Oplossing: Een "Twee-Persoons Detectiveteam"

In plaats van één groot brein te bouwen dat alles doet, bouwde het team een heterogeen ensemble. Denk hierbij aan het inhuren van twee verschillende soorten detectives om dezelfde zaak op te lossen:

  • Detective A (XLM-RoBERTa): Een veteraan die bijna alles ter wereld heeft gelezen. Hij is uitstekend in het begrijpen van de algemene sfeer en context van een zin in elke taal.
  • Detective B (mDeBERTa): Een specialist die zeer nauwkeurig let op de specifieke rangschikking van woorden en hoe ze zich tot elkaar verhouden.

Hoe ze samenwerkten:
Ze lieten ze niet zomaar stemmen; ze gaven ze een gewogen score. Als Detective A 70% zeker is en Detective B 30% zeker, dan leunt het eindantwoord zwaar op Detective A. Deze combinatie maakte het systeem robuuster, net als een veiligheidsnet.

3. De Strategie: Elke Aanwijzing Apart Behandelen

Het team besefte dat proberen alle drie de mysteries tegelijk op te lossen (Is het gepolariseerd? Waar gaat het over? Hoe wordt het gezegd?) hetzelfde was als proberen te jongleren terwijl je op een eenwieler rijdt. De aanwijzingen voor "waarover" en "hoe" waren zo zeldzaam dat ze verloren gingen in het lawaai van de "is het gepolariseerd"-aanwijzing.

Dus besloten ze het werk te splitsen:

  • Ze trainden aparte modellen voor elke specifieke vraag.
  • Voor de zeldzame aanwijzingen (zoals specifieke soorten haatzaaiende taal) gebruikten ze een speciale truc genaamd Gewogen Cross-Entropy. Stel je een leraar voor die een toets nakijkt. Als een student een zeldzame, moeilijke vraag goed beantwoordt, geeft de leraar extra punten. Als ze een gewone vraag goed hebben, krijgen ze normale punten. Dit dwong de AI om extra aandacht te besteden aan de zeldzame, belangrijke gevallen die ze normaal gesproken negeerde.

4. Wat Ze Vonden

  • Splitsen werkt: Alles tegelijk proberen te doen (Multi-Task Learning) maakte het systeem eigenlijk slechter, omdat de zeldzame aanwijzingen de gewone verwarren. De taken gescheiden houden was de winnende zet.
  • De "Vertaal"-Valstrik: Ze probeerden berichten naar andere talen te vertalen om meer oefendata te creëren (Data Augmentation), maar dit hielp niet veel. Het is alsof je een grap vertaalt; de woorden kunnen wel kloppen, maar de culturele humor en nuance gaan verloren, waardoor de AI in de war raakt.
  • De Resultaten: Hun systeem was zeer goed in het opsporen van de "rode knikkers" (gepolariseerde inhoud) in alle 22 talen. In veel talen eindigden ze in de top 10 van alle teams die deelnamen. Ze hadden echter nog steeds moeite met de meest specifieke, zeldzame soorten beledigingen (de "manifestaties"), wat laat zien dat zelfs de beste AI moeite heeft om de subtielste vormen van haat op te sporen wanneer er zeer weinig voorbeelden zijn om van te leren.

In het Kort

Het artikel gaat over het bouwen van een slim, meertalig beveiligingssysteem voor sociale media. In plaats van één groot, verward brein te gebruiken, gebruikten ze een team van twee gespecialiseerde AI-modellen die samenwerken. Ze leerden deze modellen om meer om de zeldzame, gevaarlijke berichten te geven dan om de saaie. Hoewel ze niet elk probleem oplosten (vooral de zeer zeldzame soorten haatzaaiende taal), bewezen ze dat het splitsen van taken en het combineren van verschillende soorten AI-heren de beste manier is om een rommelige, meertalige wereld aan te pakken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →